วันอังคารที่ 23 กันยายน 2026 Google เปิดตัวโมเดลแปลงข้อความเป็นเสียงรุ่นใหม่สองตัว คือ Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS โดยเคลมว่าเป็น "โมเดลเสียงที่สื่ออารมณ์ได้ดีที่สุดเท่าที่เคยทำมา"
เกิดอะไรขึ้น
จุดขายหลักของรอบนี้คือความยืดหยุ่นในการ "ออกแบบเสียง" ด้วยภาษาพูดธรรมดา:
- สร้างเสียงเองจากศูนย์ — กำหนดบทบาท สำเนียง และคาแรกเตอร์ของเสียงได้ผ่านการพิมพ์สั่ง (prompt) ครอบคลุม กว่า 100 ภาษาและสำเนียง
- เลือกจากคลังเสียงสำเร็จรูป — มีเสียงพร้อมใช้ กว่า 2,000 เสียง รวมถึงสำเนียงย่อยอย่าง Quebec French, Scots English และ Mexican Spanish
- คุมการแสดงทีละบรรทัด — สั่งจังหวะ การเน้นเสียง แทรกเสียงหัวเราะ หรือคำรับอย่าง "อืม" ได้ พร้อมสร้างเสียงต่อเนื่องยาวเป็นชั่วโมงโดยไม่สะดุด
สองรุ่นแยกหน้าที่กันชัดเจน: Flash TTS เน้นงานคุณภาพสูงอย่างเกม ออดิโอบุ๊ก และพอดแคสต์ ส่วน Flash-Lite TTS ปรับโทนและจังหวะเองแบบเรียลไทม์ เหมาะกับ เสียงของ voice agent ที่ต้องตอบโต้ทันที
แปลว่าอะไร
ที่ผ่านมาการทำเสียงพากย์หรือเสียงผู้ช่วยที่ฟัง "เป็นธรรมชาติ" มักต้องจ้างนักพากย์หรือใช้เครื่องมือแยกที่แพงและช้า การสั่งสร้างเสียงด้วยประโยคเดียวแล้วคุมอารมณ์ได้ทีละบรรทัด จึงลดกำแพงเรื่องต้นทุนและเวลาลงอย่างมาก
น่าสังเกตว่าทั้งสองรุ่นคว้าอันดับ 1 และ 2 บนดัชนี Overall Quality Index ของ Hume AI ซึ่งเป็นสัญญาณว่าคุณภาพเสียงสังเคราะห์กำลังไล่จี้เสียงคนจริงเข้าไปทุกที
ถ้าอยากลอง เริ่มจากงานที่ต้องอ่านออกเสียงซ้ำ ๆ เช่น สคริปต์วิดีโอสั้น หรือเสียงตอบรับอัตโนมัติ แล้วค่อยขยับไปงานยาวขึ้น — และควรตรวจการออกเสียงคำภาษาไทยเฉพาะทางก่อนนำไปใช้จริงทุกครั้ง
