5 โมเดลในชุดเดียว

ชุด Qwen-Audio-3.1 ประกอบด้วย ASR ถอดเสียงเป็นข้อความพร้อมตัดคำฟุ่มเฟือย รองรับ 30 ภาษาและภาษาถิ่นจีน 16 สำเนียง (อัตราผิดพลาดระดับตัวอักษรเฉลี่ย 4.55% ในชุดทดสอบสาธารณะ), ASR-Next ที่แยกผู้พูดหลายคนพร้อม timestamp และจับอารมณ์กับเสียงแวดล้อมได้, TTS แปลงข้อความเป็นเสียงหลายภาษาที่ย้ายเสียงข้ามภาษาได้และสั่งอารมณ์ ความเร็ว สไตล์การพูดด้วยข้อความ, Realtime สำหรับคุยสดแบบพูดและฟังพร้อมกัน ขัดจังหวะได้ทันที (อัตราทำงานสำเร็จขึ้นจาก 78.4% เป็น 82.0%) และตัวใหม่ TTS-Next

TTS-Next: เสียงพากย์ เอฟเฟกต์ บรรยากาศ ในรอบเดียว

TTS-Next เป็นโมเดลแบบ diffusion ที่รับข้อความและเสียงอ้างอิง แล้วเจนเสียงออกมาได้ทั้งเสียงพูดคนเดียว บทสนทนาหลายคน พอดแคสต์ ซาวด์สเคปแบบภาพยนตร์ เสียงบรรยากาศ และเสียงเอฟเฟกต์ ตามเอกสาร Alibaba Cloud Model Studio รับข้อความได้สูงสุด 3,000 ตัวอักษร เจนได้ยาวสุด 240 วินาทีสำหรับพอดแคสต์ และ 120 วินาทีสำหรับงานอื่น ส่งเสียงอ้างอิงได้สูงสุด 3 คลิป (คลิปละไม่เกิน 30 วินาที) เพื่อคุมเสียงให้คงที่ ส่งออกเป็น WAV, MP3 หรือ PCM — แต่ตอนนี้รองรับเฉพาะภาษาจีนและอังกฤษเท่านั้น

ราคาใหม่

ตามรายงานของ 36Kr ราคาหลังลด (ต่อ 1 ล้านโทเคน) ได้แก่ ASR-Flash 0.8 หยวนขาเข้า / 2.7 หยวนขาออก, TTS-Flash 1.5 / 12 หยวน และ TTS-Next 6 / 12 หยวน ส่วน Realtime-Plus อยู่ที่ 5–40 หยวนขาเข้า / 40–150 หยวนขาออก ขณะที่หน้าเอกสารของ Alibaba Cloud ระบุราคา TTS-Next ในภูมิภาคปักกิ่งที่ 0.848 ดอลลาร์ขาเข้า และ 1.696 ดอลลาร์ขาออก ต่อ 1 ล้านโทเคน API ส่วนใหญ่เปิดใช้บนแพลตฟอร์ม Qwen แล้ว ยกเว้น ASR-Next ที่ยังไม่เปิด API

มุมมองของเรา

สงครามราคาเสียง AI กำลังตามรอยสงครามราคาวิดีโอ AI — เสียงพากย์ เสียงเอฟเฟกต์ และบรรยากาศที่เคยต้องจ้างแยกหลายส่วน กำลังถูกลงจนแทบเป็นต้นทุนเล็กๆ ในงานผลิต แต่ข้อจำกัดเรื่องภาษาไทยยังเป็นโจทย์จริง โมเดลใหม่หลายตัวยังไม่รองรับไทย และเสียงไทยที่ออกมาไม่ดีทำให้งานทั้งชิ้นดูถูกทันที All-In AI Labs เลือกเครื่องมือเสียงที่เหมาะกับแต่ละงานและคุมคุณภาพเสียงไทยให้เข้ากับภาพ ผลิต AI Video คุณภาพสูงครบวงจรตั้งแต่สคริปต์ ภาพ เสียง จนถึงตัดต่อ ในงบที่ถูกกว่า production ปกติ