เสียง AI ของ Google สองทาง Gemini 3.8 TTS กับ Live API คุยสด
โดย Nokka (นก-กา) | 24 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
ผมไล่อ่านทั้งสองประกาศที่ Google ปล่อยพร้อมกันเมื่อวันพุธที่ผ่านมา แล้วพบว่ามันเป็นสองฟากของงานเสียงเดียวกัน ด้านแรกคือโมเดลสร้างเสียงพูดสองตัวใหม่ในตระกูล Gemini 3.8 ที่เปลี่ยนงานอ่านออกเสียงจากการเลือกเสียงสำเร็จมาเป็นสตูดิโอออกแบบเสียงเต็มรูปแบบ [1][2]
อีกด้านคือบทเรียนสร้างเอเจนต์เสียงแบบเรียลไทม์ด้วย Live API สำหรับคนที่อยากได้ผู้ช่วยคุยโต้ตอบกลับทันที [3] สองอย่างนี้ตอบโจทย์คนละกลุ่มแต่เสริมกันเป็นชุดเดียว
ด้านแรก: สร้างเสียงจากศูนย์ด้วย Gemini 3.8 TTS
โมเดลใหม่มีสองตัวแยกกันตามลักษณะงาน [1]
- Gemini 3.8 Flash TTS ตัวหนัก เน้นออกแบบตัวละครและกำกับการแสดง สร้างเสียงใหม่จากศูนย์ด้วยภาษาพูดธรรมดา กำกับทีละบรรทัดได้ละเอียดถึงจังหวะ สำเนียง และเสียงตอบสนองระหว่างสนทนา
- Gemini 3.8 Flash-Lite TTS ตัวเบา เน้นงานปริมาณมากอย่างพากย์เสียง คอนเทนต์เสียง และเอเจนต์เสียงที่ต้องการต้นทุนต่ำแต่ยังคุมน้ำเสียงและจังหวะได้
| ด้าน | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| จุดเด่น | ออกแบบตัวละคร + กำกับทีละบรรทัด | ปริมาณมาก ต้นทุนต่ำ |
| งานเหมาะ | เกม หนังสือเสียง พอดแคสต์ | พากย์เสียง เอเจนต์เสียงสเกลใหญ่ |
| คุมละเอียด | จังหวะ สำเนียง เสียงตอบโต้ | น้ำเสียง จังหวะ ความละเอียดพอใช้ |
| ตำแหน่ง Hume AI | อันดับ 1 คุณภาพรวม | อันดับ 2 คุณภาพรวม |
จุดเปลี่ยนจากยุคเสียงสำเร็จคือการกำกับเชิงลึก ของเดิมมีให้เลือกราว 30 เสียง ตอนนี้ขยายเป็นคลังเสียงพร้อมใช้กว่า 2,000 เสียงพร้อมภาษาแถบถิ่นอย่างสเปนแบบเม็กซิโก ฝรั่งเศสแบบควิเบก และอังกฤษแบบสกอต หรือจะสร้างเสียงใหม่ทั้งหมดด้วยการพิมพ์บรรยาย เช่น มังกรอาลักอาลัยหรือดีเจจากเมลเบอร์น ก็ทำได้เหมือนกำกับนักแสดงจริง [1]
ตัวเลขที่ออกมาพร้อมการเปิดตัว
ผลวัดจากการทดสอบของบุคคลที่สามที่ Google อ้างอิงน่าสนใจสำหรับคนเลือกใช้ บน Voice Design Benchmark ของ Hume AI โมเดล Flash TTS ได้อันดับหนึ่งที่คะแนน 71.4 และนำเรื่องการเลียนแบบสำเนียงที่ 60.8 ส่วนบนดัชนีคุณภาพรวมของ Hume AI นั้นสองรุ่นครองอันดับหนึ่งกับสองตามลำดับ และในการทดสอบคนจริงแบบไม่บอกชื่อบน Voice Arena ทั้งคู่ขึ้นหัวตารางในหลายภาษาใหญ่ รองรับรวมกันกว่า 100 ภาษา [1]
ความปลอดภัยที่มาพร้อมเสียง
การลอกเสียงคนจริงมาใช้เป็นหัวข้ออ่อนไหวที่สุดของงานนี้ ทาง Google วางกลไกขอใคร่ยินยอมเป็นคำอัดเสียงจากเจ้าของเสียงเองที่ต้องตรงกับตัวอย่างเสียงอ้างอิงก่อนจะสร้างได้ ทุกไฟล์เสียงที่สร้างโดยตระกูลนี้ฝังลายน้ำ SynthID ที่มองไม่เห็นแต่ตรวจได้ รวมถึงข้อมูลรับรอง C2PA สำหรับรายละเอียดทางเทคนิคมี model card เปิดให้อ่าน [1]
ส่วนข้อจำกัดที่ควรรู้ก่อนใช้ในไทย ฟีเจอร์ลอกเสียงผ่าน AI Studio ยังไม่เปิดในหลายเขตแดนรวมถึงอินเดียและยุโรป ส่วนภูมิภาคของเรายังต้องตรวจสิทธิ์การใช้จากหน้า API โดยตรง [1]
ด้านที่สอง: คุยสดแบบเรียลไทม์ด้วย Live API
บทเรียนของ Google Cloud เจาะโจทย์ต่อจากการสร้างเสียง คือการทำให้เอเจนต์คุยกับคนได้ทันทีแบบที่เราคุยกับผู้ช่วยอัจฉริยะบนมือถือ [3]
Live API เป็นอินเทอร์เฟซสองทางแบบเรียลไทม์ที่ยังอยู่ในช่วงพรีวิว เชื่อมต่อผ่าน WebSocket ให้โมเดลรับเสียงพูดและวิดีโอเข้า แล้วตอบกลับเป็นเสียงหรือข้อความได้ในการเชื่อมต่อเดียว [4]
จุดที่คนทำงานจริงต้องรู้คือการจัดการตอบกลับ เพราะเหตุการณ์หนึ่งจากเซิร์ฟเวอร์อาจบรรจุหลายส่วนเนื้อหามาพร้อมกัน โค้ดต้องอ่านทุกส่วนในเหตุการณ์เดียว มิฉะนั้นข้อมูลจะหลุด [4]
สามความสามารถที่ทำให้เหมาะกับงานจริง
- คิดก่อนตอบได้ ปรับระดับการคิดด้วย thinkingLevel ตั้งแต่น้อยสุดจนถึงสูง ตั้งค่าเริ่มต้นไว้ที่น้อยสุดเพื่อเร็วที่สุด [4]
- ตรวจจังหวะเสียงเอง มีระบบ VAD แยกช่วงพูดกับช่วงเงียบอัตโนมัติ หรือจะสั่งเองด้วย activityStart กับ activityEnd ก็ได้สำหรับระบบที่ต้องการคุมเข้ม [4]
- เรียกเครื่องมือกลางสนทนา รองรับการเรียกฟังก์ชันแบบไม่บล็อก ทำให้เอเจนต์พูดคุยไปดึงข้อมูลไปได้พร้อมกัน [4]
เลือกทางไหนสำหรับงานคุณ
สองเส้นทางนี้ตอบคนละโจทย์ ถ้างานคือสร้างคอนเทนต์เสียง เช่น หนังสือเสียง พอดแคสต์ พากย์เสียง หรือเสียงตัวละครในเกม เริ่มจาก AI Studio ที่เปิดใช้ฟรีแบบสตูดิโอออกแบบเสียง [2] แต่ถ้างานคือผู้ช่วยที่ต้องคุยกับคนจริงตอนนี้ เช่น คอลเซ็นเตอร์เสียง ผู้ช่วยในร้านค้า หรือระบบสอนภาษา ทางที่ถูกคือ Live API ผ่าน Gemini API หรือแพลตฟอร์มพันธมิตรอย่าง Agora, LiveKit และ Vercel ที่เปิดใช้โมเดลใหม่แล้ว [1][4]
ข้อควรระวังก่อนจบ Live API ยังเป็นพรีวิว อย่าเอาไปผูกกับระบบหลักที่ต้องเสถียรสุดขั้วโดยไม่มีแผนสำรอง ส่วนโมเดล TTS ทั้งสองเพิ่งเปิดตัว ตัวเลข benchmark มาจากการอ้างอิงของ Google เอง ควรลองกับเสียงภาษาไทยจริงก่อนตัดสินใจใช้ในงานผลิต
อ้างอิง:
[1] Rechis, Leland & Cowen, Alan. "Gemini 3.8 text-to-speech says hello." blog.google, 23 กันยายน 2026. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech
[2] Google AI Studio. "Gemini 3.8 text-to-speech." x.com, 23 กันยายน 2026. https://x.com/GoogleAIStudio/status/2102795277593653552
[3] Google Cloud Tech. "How to Build a Real-Time Voice AI Agent with the Gemini Live API." x.com, 23 กันยายน 2026. https://x.com/GoogleCloudTech/status/2102773125960134804
[4] Google. "Live API capabilities guide." ai.google.dev, 2026. https://ai.google.dev/gemini-api/docs/live-guide

Top comments (0)