ตัวเลขที่ทำให้รันบนเครื่องทั่วไปได้
- หน่วยความจำที่ต้องใช้ลดจาก 123.6 GB เหลือ 42.5 GB ด้วยเทคนิค parameter pruning ผสม int8 quantization
- รันได้จริงบนการ์ดจอระดับ RTX 3060 — ไม่ต้องพึ่งเครื่องระดับ workstation
- รองรับผ่าน ComfyUI เวอร์ชัน 0.30.0 ขึ้นไป มี workflow template ให้โหลดใช้ทันที และมีตัวเลือกรันบน Comfy Cloud ด้วย
- น้ำหนักโมเดลเผยแพร่บน Hugging Face (Comfy-Org/MiniMax-H3) ภายใต้ minimax-h3-community-license-agreement พร้อม checkpoint หลายระดับ quantization (bf16, int8, fp8, fp4) ให้เลือกตามสเปกเครื่อง
เสียงที่เป็นส่วนหนึ่งของโมเดล ไม่ใช่ post-process
จุดที่ทีม ComfyUI เน้นย้ำคือเสียงสเตอริโอใน H3 เจนออกมาพร้อมกับวิดีโอในขั้นตอนเดียว ไม่ใช่การแปะเสียงทีหลังแบบโมเดลรุ่นก่อน โมเดลรองรับทั้ง image-to-video, text-to-video และ reference-to-video ผ่านชุด audio VAE ที่แพ็กมาด้วยกัน
มุมมองของเรา
เทรนด์ open weights วิดีโอ AI ที่เริ่มจาก LTX-2 เมื่อกลางปีกำลังขยายไปถึงโมเดลระดับท็อปของ leaderboard อย่าง H3 แล้ว สำหรับงานที่ต้องเก็บ footage เป็นความลับหรือทำ iteration จำนวนมากในสตูดิโอ การมีตัวเลือกรันในเครื่องช่วยตัดต้นทุนต่อคลิปได้จริง แต่ทีม production ยังต้องคัดคุณภาพและ QC เองก่อนส่งงานลูกค้าเสมอ ไม่ว่าจะรันจากคลาวด์หรือรันในเครื่อง
ALL-IN