ผู้ใช้งานชื่อ qMLX ได้แก้ไขบั๊ก 3 จุดในระบบ serving stack ทำให้โมเดล Qwen3.5-122B ทำงานได้ดีบน Mac Studio โดยเฉพาะการจัดการ cache ที่เคยมีปัญหาจากการใช้ timestamp ใน prompt และ hybrid attention architecture ที่ทำให้ cache หายไปโดยไม่ตั้งใจ ผู้ใช้เลือกเปลี่ยนจาก DS4 Flash มาใช้ Qwen3.5-122B เนื่องจากปัญหา latency ในการ prefill ของโมเดลเดิม ซึ่ง Qwen3.5-122B แสดงประสิทธิภาพดีกว่าในด้านการใช้ memory และการจัดการงานที่ต้องใช้ context ยาวนาน พร้อมกับการปรับปรุง cache invalidation ที่ขาดหายไปเมื่อโมเดลเปลี่ยนไป การแก้ไขนี้ทำให้ระบบสามารถใช้โมเดลขนาดใหญ่ได้โดยไม่สูญเสียประสิทธิภาพ และเปิดโอกาสให้ใช้งานในงาน agentic coding ที่ต้องการความเสถียรของ memory management การเปลี่ยนมาใช้ Qwen3.5-122B เกิดจากความต้องการใช้งาน agentic coding ที่ต้องการการตอบสนองเร็วและจัดการ context ยาวนาน โดยเฉพาะการปรับปรุง cache invalidation ที่เคยขาดหายไป ซึ่งเป็นปัญหาหลักเมื่อโมเดลเปลี่ยนไป โมเดล Qwen3.5-122B ถูกเลือกเนื่องจากเหมาะสมกับฮาร์ดแวร์ M3 Ultra ทั้งในด้าน memory bandwidth และการจัดการ KV cache ที่ใช้ unified memory 96GB ได้อย่างมีประสิทธิภาพ
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว