ไม่ใช่ avatar ต่อสายพานอีกต่อไป
ระบบ avatar แบบเดิมจะส่งบทสนทนาผ่านหลายโมเดลต่อกัน คือแปลงเสียงเป็นข้อความ ส่งเข้า language model แปลงกลับเป็นเสียง แล้วค่อยให้ avatar ขยับปาก ส่วน Griffin เป็นโมเดล full-duplex แบบ video-to-video ที่รับรู้ ตัดสินใจว่าจะตอบเมื่อไรและอย่างไร แล้วเจนทั้งเสียงและภาพไปพร้อมกัน มันประเมินบทสนทนาใหม่หลายครั้งต่อวินาที จึงพยักหน้าหรือพูด “อืม” ได้ระหว่างที่อีกฝ่ายยังพูดอยู่ หยุดเมื่อถูกพูดแทรก และตอบสนองต่อสิ่งที่เห็นในกล้องได้ ตัวโมเดลเจนทั้งฉาก ตั้งแต่สีหน้า ท่าทาง การขยับตัว เงา ไปจนถึงฉากหลัง
ตัวเลขจากการทดสอบ
ในการทดสอบ ผู้ร่วมทดสอบถูกบอกว่าจะได้คุยกับ “ผู้ร่วมทดสอบอีกคน” ผลคือ 48% เชื่อว่าเป็นคนจริง เทียบกับระบบเดิมของ Tavus ที่ใช้ Phoenix-4.5 ซึ่งหลอกได้เพียง 1 จาก 41 คน (2.4%) บน benchmark VideoFDB ของ NVIDIA ที่วัดเมื่อ ก.ย. 2026 Griffin ได้อันดับ 1 ทั้งสองหมวดจาก 15 โมเดล คะแนนด้านการเจนอยู่ที่ 3.83 จาก 5 ใกล้กับค่าอ้างอิงของมนุษย์ที่ 3.92 และทิ้งอันดับถัดไป (Gemini 2.5 + Anam) ที่ 2.80 ส่วนด้านการรับรู้ได้ 3.73 เทียบกับมนุษย์ 4.20 ภาพออกที่ 720p ดีเลย์ระหว่างเสียงกับภาพเฉลี่ย 0.43 วินาที
ยังไม่เปิดให้ใช้ เพราะเรื่องความปลอดภัย
ตอนนี้ Griffin-Lite เปิดเป็น research preview ให้เฉพาะผู้ทดสอบที่ได้รับเชิญเท่านั้น ยังไม่มีใน API และยังไม่ประกาศราคา Tavus ยอมรับเองว่าคุณสมบัติที่ทำให้โมเดลนี้คุยได้เป็นธรรมชาติ ก็เป็นคุณสมบัติเดียวกับที่ใช้หลอกคนได้ จึงกำลังพัฒนาฟีเจอร์เปิดเผยตัวตนว่าเป็น AI และทำงานร่วมกับองค์กรด้านความปลอดภัย AI ก่อนปล่อยวงกว้าง ตัวอย่างการใช้งานที่บริษัทยกมาคือติวเตอร์ ซ้อมสนทนาเชิงอาชีพ ฝ่ายบริการลูกค้า พนักงานขาย AI งานสุขภาพ และการสัมภาษณ์
มุมมองของเรา
เส้นแบ่งระหว่าง “คนจริง” กับ “คนที่ AI สร้าง” บนจอแคบลงทุกเดือน ทั้งในวิดีโอคอลและวิดีโอโฆษณา สิ่งที่จะทำให้แบรนด์ต่างจากคนอื่นจึงไม่ใช่แค่ว่าใช้ AI ได้ แต่คือการคุมบท คุมภาพ คุมตัวละครให้สม่ำเสมอ และเปิดเผยการใช้ AI อย่างโปร่งใส All-In AI Labs ทำ AI Video Production ที่ได้ภาพสมจริงระดับแบรนด์ คุมนักแสดง AI ให้หน้าเหมือนเดิมทุกคัต ในงบที่ถูกกว่า production ปกติ
ALL-IN