AI & MACHINE LEARNING

Google เปิดตัว Gemini 3.8 Live with Live Avatar สร้างตัวตนเสมือนโต้ตอบได้สมจริงด้วยวิดีโอและเสียง

Google DeepMind24 Sep 2026
1 min read
Key Takeaways
  • Live Avatar คือก้าวสำคัญของ Multimodal AI ที่ทำให้การสนทนากับคอมพิวเตอร์มีความเป็นธรรมชาติและดึงดูดผู้ใช้งานได้มากขึ้นผ่านภาพและเสียง

ทำไมเรื่องนี้ถึงสำคัญ

เทคโนโลยีนี้นำไปสู่การเปลี่ยนโฉมงานบริการลูกค้าและการเรียนรู้ออนไลน์ โดยเปลี่ยนจากแชทบอทข้อความธรรมดามาเป็นพนักงานเสมือนที่มีรูปลักษณ์และอารมณ์เหมือนมนุษย์

Google ยกระดับการโต้ตอบกับ AI ไปอีกขั้นด้วยการเปิดตัว Gemini 3.8 Live with Live Avatar ซึ่งเป็นการผสานการประมวลผลภาพวิดีโอและเสียงเข้าด้วยกันแบบเรียลไทม์ ฟีเจอร์นี้ช่วยให้ AI มีรูปลักษณ์ที่มองเห็นได้ มีการขยับปาก (Lip-sync) ที่แม่นยำ และมีการแสดงออกทางสีหน้าที่เป็นธรรมชาติขณะสนทนา

นอกจากด้านภาพแล้ว ระบบยังรองรับการทำงานเบื้องหลังอย่างชาญฉลาดผ่าน Asynchronous Tool Calling ทำให้ Avatar สามารถไปดึงข้อมูลหรือทำงานอื่นๆ ขณะที่ยังสนทนากับผู้ใช้ได้อย่างต่อเนื่อง ไม่มีการหยุดชะงัก องค์กรธุรกิจสามารถปรับแต่งรูปลักษณ์ของ Avatar ให้ตรงกับแบรนด์ของตนเองได้ (ผ่านระบบ allowlist) และระบบยังรองรับการสลับภาษาไปมาได้ถึง 97 ภาษาโดยที่ภาพยังคงคุณภาพสูงและไม่มีอาการดีเลย์

สรุปประเด็นหลัก

เปิดตัวระบบ Avatar ที่โต้ตอบแบบเรียลไทม์พร้อมการขยับปากและอารมณ์ที่สมจริง

รองรับการทำงานซ้อน (Tool calling) โดยไม่ขัดจังหวะการสนทนา

ใช้งานได้ 97 ภาษา และปรับแต่งรูปลักษณ์ตามแบรนด์ได้ในระดับ Enterprise

นวัตกรรมและเทคโนโลยี

creative ai

Real-time Visual Presence

การสร้างวิดีโอตัวตนเสมือนที่ตอบสนองต่อเสียงสนทนาได้ทันทีด้วยความหน่วงต่ำ

platform

Multilingual Sync

ระบบขยับปากและแสดงอารมณ์ที่ปรับเปลี่ยนตามภาษาที่พูดได้โดยอัตโนมัติถึง 97 ภาษา

Developer Impact
นักพัฒนาในกลุ่ม Enterprise สามารถเริ่มใช้งานผ่าน API เพื่อสร้างหน้าอินเทอร์เฟซสำหรับพนักงานต้อนรับหรือครูสอนภาษาเสมือนที่ตอบสนองได้ทันที
Keywords
#gemini 3.8 live #live avatar #multimodal ai #virtual human #synthid
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

Google DeepMind