นักวิจัยเปิดเผยการโจมตีที่ใช้ช่องโหว่ในระบบเข้ารหัสของ Anthropic, OpenAI และ Google โดยข้อมูลการคิด (reasoning) จากโมเดลภาษาขนาดใหญ่ (LLM) ที่ส่งกลับผ่าน API สามารถถูกดึงกลับมาใช้ซ้ำได้ แม้จะเข้ารหัส โดยวิธีการนำ 'บล็อกที่เข้ารหัส' (encrypted chain-of-thought blocks) ไปใช้กับโมเดลรอง (weaker sibling) แล้วใช้การ jailbreak เพื่อแปลงข้อมูลเป็น plaintext โดยไม่ต้องโจมตีโมเดลหลักโดยตรง หรือเปิดใช้งานระบบป้องกัน anti-distillation ที่มีอยู่ แม้โมเดลหลักจะมีการป้องกันข้อมูลอยู่แล้วก็ตาม การโจมตีอาศัยการนำ 'trace' จากโมเดลระดับสูงไปใช้ซ้ำข้ามเซสชัน ผู้ใช้ และโมเดล ซึ่งเป็นช่องโหว่ที่ระบบเข้ารหัสไม่ได้ป้องกันการใช้ข้อมูลซ้ำ ทำให้ข้อมูลที่ถูกซ่อนอยู่ในโมเดลระดับสูงสามารถถูกเปิดเผยผ่านโมเดลรองได้ แม้จะไม่มีการโจมตีโมเดลหลักโดยตรงก็ตาม
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว