AI & MACHINE LEARNING

GAD-RL: เทคนิคใหม่แก้ปัญหา AI อ่านข้อความจากภาพผิดเพี้ยนเพราะความฉลาดเกิน

arXiv01 Oct 2026
1 min read
Key Takeaways
  • การปรับลดความเข้มงวดในการสอนของโมเดลครู (Teacher) ช่วยให้โมเดล OCR มีความซื่อตรงต่อภาพต้นฉบับมากขึ้นและลดอาการ 'คิดไปเอง' ของโมเดล

ทำไมเรื่องนี้ถึงสำคัญ

ช่วยให้ระบบดึงข้อมูลจากเอกสาร (Data Extraction) มีความน่าเชื่อถือสูงขึ้น ลดความผิดพลาดในการตีความข้อความที่มีรูปแบบเฉพาะตัวหรือข้อความที่สะกดผิดโดยตั้งใจในภาพ

ปัญหาใหญ่ของ Vision-Language Models (VLMs) ในงาน OCR คือการที่โมเดลมักจะ 'แก้คำ' ที่เห็นในภาพให้ดูเป็นธรรมชาติหรือถูกต้องตามหลักภาษา ทั้งที่ในภาพจริงอาจเป็นคำเฉพาะหรือข้อความที่ผิดปกติ (Anomalous text) งานวิจัยนี้จึงเสนอ GAD-RL (Gated and Attenuated On-Policy Distillation) เพื่อแก้ปัญหานี้

กลไกของ GAD-RL จะปรับระดับการควบคุมจากโมเดลครู (Teacher Model) อย่างชาญฉลาด หากโมเดลนักเรียนทำคะแนนได้ดีอยู่แล้ว ระบบจะลดหรือปิดการกลั่นกรอง (Distillation) เพื่อป้องกันการถูกครอบงำจนสูญเสียความเที่ยงตรงต่อข้อมูลต้นฉบับ เมื่อทดสอบกับ Qwen3.5-2B พบว่าให้ผลลัพธ์ความแม่นยำ (Micro Recall) สูงกว่าวิธีการมาตรฐานทั่วไปอย่างมาก ซึ่งช่วยให้การดึงข้อมูลจากเอกสารทำได้อย่างซื่อตรงและแม่นยำกว่าเดิม

สรุปประเด็นหลัก

GAD-RL ปรับระดับการ Distillation ตามประสิทธิภาพการทำงานจริงของโมเดลนักเรียน

ช่วยลดปัญหาโมเดลเขียนทับข้อความในภาพด้วยประโยคที่ดูดีแต่ไม่ถูกต้อง

ทำคะแนน Overall ได้ถึง 91.18 ใน OmniDocBench v1.6 ซึ่งเป็นระดับแนวหน้าของวงการ

นวัตกรรมและเทคโนโลยี

research

Adaptive Distillation Control

ระบบควบคุมการถ่ายทอดความรู้จากโมเดลครูตามความสามารถของผู้เรียนเพื่อรักษาความเที่ยงตรงของข้อมูล

tools

OCR Faithfulness Enhancement

ฟีเจอร์ที่เน้นการถอดรหัสข้อความจากภาพให้ตรงตามต้นฉบับมากที่สุดโดยไม่ปรับแต่งตามหลักภาษา

Developer Impact
นักพัฒนาที่สร้างระบบอ่านเอกสารอัตโนมัติ (Intelligent Document Processing) สามารถใช้เทคนิคนี้เพื่อลดอัตราการเกิด Hallucination ในงาน OCR
Keywords
#ocr #vision-language models #gad-rl #knowledge distillation
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

arXiv