DEV Community

Nokka
Nokka

Posted on AI-assisted

เสียง AI ของ Google สองทาง Gemini 3.8 TTS กับ Live API คุยสด

เสียง AI ของ Google สองทาง Gemini 3.8 TTS กับ Live API คุยสด

โดย Nokka (นก-กา) | 24 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

ผมไล่อ่านทั้งสองประกาศที่ Google ปล่อยพร้อมกันเมื่อวันพุธที่ผ่านมา แล้วพบว่ามันเป็นสองฟากของงานเสียงเดียวกัน ด้านแรกคือโมเดลสร้างเสียงพูดสองตัวใหม่ในตระกูล Gemini 3.8 ที่เปลี่ยนงานอ่านออกเสียงจากการเลือกเสียงสำเร็จมาเป็นสตูดิโอออกแบบเสียงเต็มรูปแบบ [1][2]

อีกด้านคือบทเรียนสร้างเอเจนต์เสียงแบบเรียลไทม์ด้วย Live API สำหรับคนที่อยากได้ผู้ช่วยคุยโต้ตอบกลับทันที [3] สองอย่างนี้ตอบโจทย์คนละกลุ่มแต่เสริมกันเป็นชุดเดียว

การ์ดสรุปเสียง AI สองทางของ Google

ด้านแรก: สร้างเสียงจากศูนย์ด้วย Gemini 3.8 TTS

โมเดลใหม่มีสองตัวแยกกันตามลักษณะงาน [1]

  • Gemini 3.8 Flash TTS ตัวหนัก เน้นออกแบบตัวละครและกำกับการแสดง สร้างเสียงใหม่จากศูนย์ด้วยภาษาพูดธรรมดา กำกับทีละบรรทัดได้ละเอียดถึงจังหวะ สำเนียง และเสียงตอบสนองระหว่างสนทนา
  • Gemini 3.8 Flash-Lite TTS ตัวเบา เน้นงานปริมาณมากอย่างพากย์เสียง คอนเทนต์เสียง และเอเจนต์เสียงที่ต้องการต้นทุนต่ำแต่ยังคุมน้ำเสียงและจังหวะได้
ด้าน Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
จุดเด่น ออกแบบตัวละคร + กำกับทีละบรรทัด ปริมาณมาก ต้นทุนต่ำ
งานเหมาะ เกม หนังสือเสียง พอดแคสต์ พากย์เสียง เอเจนต์เสียงสเกลใหญ่
คุมละเอียด จังหวะ สำเนียง เสียงตอบโต้ น้ำเสียง จังหวะ ความละเอียดพอใช้
ตำแหน่ง Hume AI อันดับ 1 คุณภาพรวม อันดับ 2 คุณภาพรวม

จุดเปลี่ยนจากยุคเสียงสำเร็จคือการกำกับเชิงลึก ของเดิมมีให้เลือกราว 30 เสียง ตอนนี้ขยายเป็นคลังเสียงพร้อมใช้กว่า 2,000 เสียงพร้อมภาษาแถบถิ่นอย่างสเปนแบบเม็กซิโก ฝรั่งเศสแบบควิเบก และอังกฤษแบบสกอต หรือจะสร้างเสียงใหม่ทั้งหมดด้วยการพิมพ์บรรยาย เช่น มังกรอาลักอาลัยหรือดีเจจากเมลเบอร์น ก็ทำได้เหมือนกำกับนักแสดงจริง [1]

ตัวเลขที่ออกมาพร้อมการเปิดตัว

ผลวัดจากการทดสอบของบุคคลที่สามที่ Google อ้างอิงน่าสนใจสำหรับคนเลือกใช้ บน Voice Design Benchmark ของ Hume AI โมเดล Flash TTS ได้อันดับหนึ่งที่คะแนน 71.4 และนำเรื่องการเลียนแบบสำเนียงที่ 60.8 ส่วนบนดัชนีคุณภาพรวมของ Hume AI นั้นสองรุ่นครองอันดับหนึ่งกับสองตามลำดับ และในการทดสอบคนจริงแบบไม่บอกชื่อบน Voice Arena ทั้งคู่ขึ้นหัวตารางในหลายภาษาใหญ่ รองรับรวมกันกว่า 100 ภาษา [1]

ความปลอดภัยที่มาพร้อมเสียง

การลอกเสียงคนจริงมาใช้เป็นหัวข้ออ่อนไหวที่สุดของงานนี้ ทาง Google วางกลไกขอใคร่ยินยอมเป็นคำอัดเสียงจากเจ้าของเสียงเองที่ต้องตรงกับตัวอย่างเสียงอ้างอิงก่อนจะสร้างได้ ทุกไฟล์เสียงที่สร้างโดยตระกูลนี้ฝังลายน้ำ SynthID ที่มองไม่เห็นแต่ตรวจได้ รวมถึงข้อมูลรับรอง C2PA สำหรับรายละเอียดทางเทคนิคมี model card เปิดให้อ่าน [1]

ส่วนข้อจำกัดที่ควรรู้ก่อนใช้ในไทย ฟีเจอร์ลอกเสียงผ่าน AI Studio ยังไม่เปิดในหลายเขตแดนรวมถึงอินเดียและยุโรป ส่วนภูมิภาคของเรายังต้องตรวจสิทธิ์การใช้จากหน้า API โดยตรง [1]

ด้านที่สอง: คุยสดแบบเรียลไทม์ด้วย Live API

บทเรียนของ Google Cloud เจาะโจทย์ต่อจากการสร้างเสียง คือการทำให้เอเจนต์คุยกับคนได้ทันทีแบบที่เราคุยกับผู้ช่วยอัจฉริยะบนมือถือ [3]

Live API เป็นอินเทอร์เฟซสองทางแบบเรียลไทม์ที่ยังอยู่ในช่วงพรีวิว เชื่อมต่อผ่าน WebSocket ให้โมเดลรับเสียงพูดและวิดีโอเข้า แล้วตอบกลับเป็นเสียงหรือข้อความได้ในการเชื่อมต่อเดียว [4]

จุดที่คนทำงานจริงต้องรู้คือการจัดการตอบกลับ เพราะเหตุการณ์หนึ่งจากเซิร์ฟเวอร์อาจบรรจุหลายส่วนเนื้อหามาพร้อมกัน โค้ดต้องอ่านทุกส่วนในเหตุการณ์เดียว มิฉะนั้นข้อมูลจะหลุด [4]

สามความสามารถที่ทำให้เหมาะกับงานจริง

  • คิดก่อนตอบได้ ปรับระดับการคิดด้วย thinkingLevel ตั้งแต่น้อยสุดจนถึงสูง ตั้งค่าเริ่มต้นไว้ที่น้อยสุดเพื่อเร็วที่สุด [4]
  • ตรวจจังหวะเสียงเอง มีระบบ VAD แยกช่วงพูดกับช่วงเงียบอัตโนมัติ หรือจะสั่งเองด้วย activityStart กับ activityEnd ก็ได้สำหรับระบบที่ต้องการคุมเข้ม [4]
  • เรียกเครื่องมือกลางสนทนา รองรับการเรียกฟังก์ชันแบบไม่บล็อก ทำให้เอเจนต์พูดคุยไปดึงข้อมูลไปได้พร้อมกัน [4]

เลือกทางไหนสำหรับงานคุณ

สองเส้นทางนี้ตอบคนละโจทย์ ถ้างานคือสร้างคอนเทนต์เสียง เช่น หนังสือเสียง พอดแคสต์ พากย์เสียง หรือเสียงตัวละครในเกม เริ่มจาก AI Studio ที่เปิดใช้ฟรีแบบสตูดิโอออกแบบเสียง [2] แต่ถ้างานคือผู้ช่วยที่ต้องคุยกับคนจริงตอนนี้ เช่น คอลเซ็นเตอร์เสียง ผู้ช่วยในร้านค้า หรือระบบสอนภาษา ทางที่ถูกคือ Live API ผ่าน Gemini API หรือแพลตฟอร์มพันธมิตรอย่าง Agora, LiveKit และ Vercel ที่เปิดใช้โมเดลใหม่แล้ว [1][4]

ข้อควรระวังก่อนจบ Live API ยังเป็นพรีวิว อย่าเอาไปผูกกับระบบหลักที่ต้องเสถียรสุดขั้วโดยไม่มีแผนสำรอง ส่วนโมเดล TTS ทั้งสองเพิ่งเปิดตัว ตัวเลข benchmark มาจากการอ้างอิงของ Google เอง ควรลองกับเสียงภาษาไทยจริงก่อนตัดสินใจใช้ในงานผลิต

อ้างอิง:

[1] Rechis, Leland & Cowen, Alan. "Gemini 3.8 text-to-speech says hello." blog.google, 23 กันยายน 2026. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech

[2] Google AI Studio. "Gemini 3.8 text-to-speech." x.com, 23 กันยายน 2026. https://x.com/GoogleAIStudio/status/2102795277593653552

[3] Google Cloud Tech. "How to Build a Real-Time Voice AI Agent with the Gemini Live API." x.com, 23 กันยายน 2026. https://x.com/GoogleCloudTech/status/2102773125960134804

[4] Google. "Live API capabilities guide." ai.google.dev, 2026. https://ai.google.dev/gemini-api/docs/live-guide

Top comments (0)