DEV Community

Nokka
Nokka

Posted on

Gemini 3.5 Transcribe, โมเดล speech-to-text ใหม่ของ Google ที่ถอดเสียง 85+ ภาษาแบบเรียลไทม์

Gemini 3.5 Transcribe, โมเดล speech-to-text ใหม่ของ Google ที่ถอดเสียง 85+ ภาษาแบบเรียลไทม์

โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 29 สิงหาคม 2026

บทความนี้เขียนโดย AI (deepseek-v4-pro via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจาก Google

Gemini 3.5 Transcribe

ก่อนอื่น, ทำความเข้าใจศัพท์

ก่อนเข้าเรื่อง ขอปูศัพท์ 3 คำที่คนอ่านบทความนี้ต้องรู้ก่อน:

  • Speech-to-Text (STT): การแปลงเสียงพูดเป็นข้อความ, เทคโนโลยีเบื้องหลังการถอดเสียง, คำสั่งเสียง, caption
  • WER (Word Error Rate): อัตราความผิดพลาดในการถอดเสียง, ยิ่งต่ำยิ่งแม่นยำ (2.6% = ผิดแค่ ~2.6 คำใน 100 คำ)
  • Diarization (การแยกผู้พูด): การระบุว่า "ใครพูด" ในบทสนทนาหลายคน

ถ้าให้อุปมา: STT คือ "นักจดบันทึก" ที่ฟังเสียงแล้วพิมพ์เป็นข้อความ, โมเดลที่ดีคือ "นักจดที่ฟังรู้เรื่องแม้มีเสียงรบกวน, จับสำเนียงได้, และแยกได้ว่าใครพูด"

เกิดอะไรขึ้น: Google เปิดตัว Gemini 3.5 Transcribe

Google เปิดตัว Gemini 3.5 Transcribe, โมเดล speech-to-text รุ่นล่าสุด 1

จุดขาย: "แม่นยำที่สุดเท่าที่เคยมี", ต่างจาก STT รุ่นเก่าที่ "แพ้" เสียงรบกวน, ศัพท์เฉพาะ, และการพูดติดขัด

2 API แยกกัน

API ใช้สำหรับ
gemini-3.5-transcribe-live Real-time streaming (sub-second latency)
gemini-3.5-transcribe Pre-recorded audio (ประชุม, call log)

จุดเด่น: ทำไมถึง "ฉลาด" กว่า STT ทั่วไป

1. แม่นยำสูง (WER ต่ำ)

โหมด WER
Streaming (real-time) 4.0%
Non-streaming (pre-recorded) 2.6%

แปลว่า: ถอดเสียงผิดแค่ ~2.6 คำใน 100 คำ, ดีกว่า Chirp 3 (รุ่นก่อน) อย่างชัดเจน [1]

2. "ฉลาด" ในการถอดเสียง

ความสามารถ ตัวอย่าง
จัดการ self-correction "เจอกันวันอังคาร... ไม่สิ วันพุธ" → ได้ "วันพุธ"
ตัด filler words "อืม... เอ่อ..." → ตัดออกอัตโนมัติ
จัดรูปแบบอัตโนมัติ ใส่ punctuation, ย่อหน้าให้เอง

3. 85+ ภาษา + แยกผู้พูด

  • ตรวจจับภาษาได้อัตโนมัติ 85+ ภาษา (รวมสำเนียงท้องถิ่น)
  • แยกผู้พูดได้สูงสุด 3 คน (3+ คนยัง experimental)

ทำไมถึงสำคัญ: ตรงกับเทรนด์ voice AI

เหตุผล คำอธิบาย
Voice agent กำลังมา STT แม่นยำ = พื้นฐานของ voice agent
ใช้ได้หลายงาน caption, call analytics, voice command
เร็วขึ้น 70% time-to-final-transcription ดีขึ้น 70% จาก Chirp 3

ข้อควรระวัง: มุมที่ต้องสมดุล

ก่อนสรุป ขอวางมุมให้ตรง:

ข้อดี ข้อควรระวัง
แม่นยำ + 85+ ภาษา ยังเป็น public preview (ไม่ stable)
2 API (streaming + batch) 3+ speakers ยัง experimental
ใช้ในหลายผลิตภัณฑ์ Google ต้องดูราคา/โควตา API

สรุปมุมมองของผม

ผมมองว่า Gemini 3.5 Transcribe คือ "ก้าวสำคัญ" ของวงการ voice AI, เพราะมันแก้ "จุดอ่อน" ที่ STT ทั่วไปแพ้มาตลอด: เสียงรบกวน, ศัพท์เฉพาะ, การพูดติดขัด

และจุดที่ผมสนใจที่สุดคือ "smart transcription", การจัดการ self-correction ("วันอังคาร... ไม่สิ วันพุธ") และตัด filler words, เพราะนี่คือสิ่งที่ทำให้ "ถอดเสียง" กลายเป็น "ข้อความที่อ่านแล้วลื่น" ไม่ใช่ "ข้อความดิบที่ต้องมาแก้ทีหลัง"

และมันสอดคล้องกับสิ่งที่ผมเขียนเรื่อง podcast มาตลอด: STT ที่ดี คือ "ก้าวแรก" ของการทำ podcast → บทความ → คอนเทนต์, เพราะถ้าถอดเสียงได้แม่นยำ + แยกผู้พูดได้ งาน "แปลงเสียงเป็นข้อความ" จะง่ายขึ้นมหาศาล

คุณเคยใช้ STT ตัวไหนบ้างครับ? แล้วคิดว่า "smart transcription" (ตัด filler + จัด self-correction) สำคัญแค่ไหน? คอมเมนต์แลกเปลี่ยนกันได้ครับ

ถ้าชอบบทความแนว AI แบบนี้ ติดตาม Nokka ได้ที่ dev.to/sarantoon

แหล่งอ้างอิง

[1] Google. "Intelligent transcription with Gemini 3.5 Transcribe". 2026. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

[2] Google AI for Developers. "Gemini 3.5 Transcribe". 2026. https://ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe


บทความนี้วิเคราะห์จากประกาศของ Google ข้อมูล ณ 29 สิงหาคม 2026 Nokka

Top comments (0)