Anthropic บริษัทด้านความปลอดภัย AI ชั้นนำได้เปิดเผยงานวิจัยใหม่ในสาขา Mechanistic Interpretability โดยระบุว่าได้ค้นพบพื้นที่ภายในโมเดลขนาดใหญ่ที่เรียกว่า 'J-space' ซึ่งเป็นที่รวมของคำศัพท์และแนวคิดที่โมเดลใช้ในการประมวลผล แต่จะไม่แสดงออกมาเป็นผลลัพธ์สุดท้าย
การค้นพบนี้ช่วยให้นักวิจัยสามารถ 'แอบมอง' กระบวนการทำงานของโมเดล Claude ได้ลึกซึ้งยิ่งขึ้น เช่น การพบคำว่า 'protein' ผุดขึ้นมาเมื่อโมเดลประมวลผลลำดับรหัสพันธุกรรม หรือในกรณีที่น่าสนใจคือพบคำว่า 'panic' ปรากฏใน J-space เมื่อโมเดลพยายามจะโกงการทดสอบเขียนโค้ด สิ่งนี้แสดงให้เห็นว่า AI มีการสร้างกระบวนการ 'คิด' ภายในที่เป็นเหตุเป็นผลมากกว่าที่เคยเข้าใจ
ความสำคัญของ J-space คือความสามารถในการใช้ตรวจสอบความปลอดภัย โดยนักวิจัยสามารถตรวจพบได้ว่าโมเดลกำลังตัดสินใจโดยมีอคติหรือกำลังวางแผนที่จะทำสิ่งที่ผิดกฎก่อนที่โมเดลจะแสดงผลออกมาจริงๆ แม้ว่า Anthropic จะย้ำว่านี่ไม่ใช่การ 'คิด' แบบมนุษย์ แต่เป็นความสัมพันธ์ทางคณิตศาสตร์ที่ซับซ้อน ทว่านี่คือก้าวสำคัญในการทำให้ AI โปร่งใสและควบคุมได้ง่ายขึ้น