Subquadratic เปิดตัว SubQ โมเดล LLM แบบ sub-quadratic ที่รองรับบริบท 12 ล้าน token ลดการใช้ทรัพยากรการคำนวณ 64.5 เท่าเมื่อเทียบกับ dense attention และเร็วกว่า FlashAttention-2 56 เท่าที่ 1 ล้าน token โดยใช้สถาปัตยกรรม sparse-attention โฟกัสเฉพาะความสัมพันธ์สำคัญระหว่างคำ ช่วยลดการคำนวณไม่จำเป็น พร้อมรองรับงานที่ต้องการบริบทยาว เช่น การวิเคราะห์ repository หรือ agent state แบบไม่สูญเสียคุณภาพ ขณะที่ API รองรับการประมวลผล full repositories และ pipeline states ในครั้งเดียวด้วยต้นทุนเชิงเส้น SubQ ยังแสดงผลลัพธ์ใกล้เคียงสมบูรณ์ใน single-fact retrieval และ multi-task retrieval ที่ระดับ scale พร้อมลดการใช้ทรัพยากร 64.5x ต่อเทียบกับ dense attention และมีประสิทธิภาพใกล้เคียงกับ FlashAttention-2 ที่ 56x ที่ 1 ล้าน token
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว