ทีมนักวิจัยเสนอเฟรมเวิร์ก CARAT เพื่อทดสอบว่า Large Language Models (LLMs) ที่ใช้ในงานด้านวัสดุศาสตร์มีความสามารถในการให้เหตุผลเชิงโครงสร้าง (Structural Reasoning) จริงหรือไม่ หรือเป็นเพียงการคัดลอกคำตอบจากฐานข้อมูลที่เคยเห็นระหว่างการฝึกสอน (Recitation) โดยงานวิจัยพบว่าเกณฑ์การวัดผล (Benchmarks) ในปัจจุบันมักมีช่องโหว่ที่ทำให้โมเดลเดาคำตอบได้ง่ายจากชื่อสูตรเคมีหรือข้อมูลที่ระบุไว้ในโจทย์
ผู้วิจัยได้พัฒนา GraphSpace ซึ่งเป็นวิธีการแสดงผลความสัมพันธ์เชิงโครงสร้างแยกจากกัน เพื่อพิสูจน์ให้เห็นว่าเมื่อข้อมูลแฝงถูกลบออกไป ประสิทธิภาพของโมเดลพื้นฐานจะลดลงอย่างมาก นอกจากนี้ยังพบว่าแม้โมเดลจะอ้างอิงความสัมพันธ์ในโครงสร้างได้ถูกต้อง แต่ในหลายกรณีโมเดลกลับไม่ได้ใช้ความสัมพันธ์นั้นในการหาคำตอบจริงๆ งานวิจัยนี้จึงเรียกร้องให้มีการสร้างเกณฑ์การวัดผลที่เข้มงวดมากขึ้นเพื่อพัฒนา AI ที่เข้าใจวิศวกรรมวัสดุอย่างแท้จริง