ตัวเลขที่ทำให้รันบนเครื่องทั่วไปได้

เสียงที่เป็นส่วนหนึ่งของโมเดล ไม่ใช่ post-process

จุดที่ทีม ComfyUI เน้นย้ำคือเสียงสเตอริโอใน H3 เจนออกมาพร้อมกับวิดีโอในขั้นตอนเดียว ไม่ใช่การแปะเสียงทีหลังแบบโมเดลรุ่นก่อน โมเดลรองรับทั้ง image-to-video, text-to-video และ reference-to-video ผ่านชุด audio VAE ที่แพ็กมาด้วยกัน

มุมมองของเรา

เทรนด์ open weights วิดีโอ AI ที่เริ่มจาก LTX-2 เมื่อกลางปีกำลังขยายไปถึงโมเดลระดับท็อปของ leaderboard อย่าง H3 แล้ว สำหรับงานที่ต้องเก็บ footage เป็นความลับหรือทำ iteration จำนวนมากในสตูดิโอ การมีตัวเลือกรันในเครื่องช่วยตัดต้นทุนต่อคลิปได้จริง แต่ทีม production ยังต้องคัดคุณภาพและ QC เองก่อนส่งงานลูกค้าเสมอ ไม่ว่าจะรันจากคลาวด์หรือรันในเครื่อง