คุมโลกด้วย "WorldPrompt" — ตั้งฉากครั้งเดียว สั่งเพิ่มเรื่อยๆ แบบไม่มีสคริปต์ตายตัว

ระบบควบคุมของ GWM Worlds 2 แบ่งเป็นสองชั้น: genesis prompt ที่บรรยายสภาพแวดล้อม ตัวละครพร้อมคุณลักษณะและเสียงพูด กับกฎพฤติกรรมของฉากไว้ตั้งแต่ต้น จากนั้นผู้ใช้ส่งคำสั่งข้อความแบบ timestamped เข้าไประหว่างทาง สั่งได้ทั้งตัวละครเฉพาะตัวหรือทั้งฉาก พร้อมคุมกล้องแบบ first-person/third-person ต่อเนื่อง (เดิน ขับรถ ขี่ ขับเครื่องบิน) รองรับ multiplayer ผ่าน LiveKit ให้หลายคนควบคุมคนละตัวละครหรือรับบท director พร้อมกัน โมเดลใช้สถาปัตยกรรม autoregressive diffusion กับ causal decoder ทั้งภาพและเสียง ทำให้ต่อฉากได้เรื่อย ๆ โดยไม่มีความยาวคลิปตายตัวแบบโมเดลวิดีโอทั่วไป

3 โหมดใช้งาน จากงานหนังไปจนถึงเกมโต้ตอบสด — แต่ยังเป็นแค่ preview ที่มีข้อจำกัด

Runway วางไว้ 3 โหมด: authoring ล่วงหน้าทั้งชุด event สำหรับงานคล้ายการทำหนัง, turn-based ที่หยุดรอการตัดสินใจแบบ visual novel, และ real-time ที่ตอบสนองคำสั่งแบบ latency ระดับมิลลิวินาทีผ่านปุ่มคีย์ ทีมงานเทียบ GWM Worlds 2 อยู่ในสนามเดียวกับ Genie ของ Google, Marble ของ World Labs และ Cosmos ของ NVIDIA แต่ยอมรับข้อจำกัดตรง ๆ ว่าโหมด real-time ยังมีปัญหารายละเอียดและเรขาคณิตเพี้ยนตอนกล้องเคลื่อนไหวเร็ว ความสม่ำเสมอระยะยาวยังไม่สมบูรณ์ และรับภาพอ้างอิงได้แค่เฟรมแรกเฟรมเดียว โหมด ahead-of-time ที่วางสคริปต์ล่วงหน้าให้คุณภาพดีกว่าโหมด real-time เสมอ

มุมมองของเรา

GWM Worlds 2 ยังไกลจากงานส่งมอบจริงของสตูดิโอวิดีโอ — 720p เป็น research preview ที่ไม่เปิดขาย และเน้นโต้ตอบสดมากกว่าคุมองค์ประกอบภาพให้เป๊ะแบบที่ลูกค้าโฆษณาต้องการ แต่ทิศทางที่ Runway วางไว้บอกอะไรบางอย่างกับสายงานวิดีโอ AI ทั้งวงการ: โมเดลกำลังขยับจาก "เจนคลิปตามพรอมต์ครั้งเดียว" ไปเป็น "จำลองฉากที่ปรับจังหวะ มุมกล้อง และบทพูดกลางอากาศได้" ซึ่งถ้าพัฒนาถึงจุดที่คุมความละเอียดและความสม่ำเสมอได้แบบโมเดลวิดีโอทั่วไป จะเปลี่ยนวิธี previz และ pitch ไอเดียให้ลูกค้าไปเลย — เห็นภาพและปรับสดในห้องประชุมแทนที่จะรอเจนใหม่ทีละคลิป ที่ All-In AI Labs เราติดตามรุ่นแบบนี้ไว้เป็นแนวทาง R&D สำหรับเวิร์กโฟลว์ preview เร็ว ๆ ในอนาคต แต่งานส่งมอบจริงวันนี้ยังคุมคุณภาพด้วยไปป์ไลน์ image-to-video ที่พิสูจน์แล้วเท่านั้น