Gemini 3.5 Transcribe, โมเดล speech-to-text ใหม่ของ Google ที่ถอดเสียง 85+ ภาษาแบบเรียลไทม์
โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 29 สิงหาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4-pro via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจาก Google
ก่อนอื่น, ทำความเข้าใจศัพท์
ก่อนเข้าเรื่อง ขอปูศัพท์ 3 คำที่คนอ่านบทความนี้ต้องรู้ก่อน:
- Speech-to-Text (STT): การแปลงเสียงพูดเป็นข้อความ, เทคโนโลยีเบื้องหลังการถอดเสียง, คำสั่งเสียง, caption
- WER (Word Error Rate): อัตราความผิดพลาดในการถอดเสียง, ยิ่งต่ำยิ่งแม่นยำ (2.6% = ผิดแค่ ~2.6 คำใน 100 คำ)
- Diarization (การแยกผู้พูด): การระบุว่า "ใครพูด" ในบทสนทนาหลายคน
ถ้าให้อุปมา: STT คือ "นักจดบันทึก" ที่ฟังเสียงแล้วพิมพ์เป็นข้อความ, โมเดลที่ดีคือ "นักจดที่ฟังรู้เรื่องแม้มีเสียงรบกวน, จับสำเนียงได้, และแยกได้ว่าใครพูด"
เกิดอะไรขึ้น: Google เปิดตัว Gemini 3.5 Transcribe
Google เปิดตัว Gemini 3.5 Transcribe, โมเดล speech-to-text รุ่นล่าสุด 1
จุดขาย: "แม่นยำที่สุดเท่าที่เคยมี", ต่างจาก STT รุ่นเก่าที่ "แพ้" เสียงรบกวน, ศัพท์เฉพาะ, และการพูดติดขัด
2 API แยกกัน
| API | ใช้สำหรับ |
|---|---|
gemini-3.5-transcribe-live |
Real-time streaming (sub-second latency) |
gemini-3.5-transcribe |
Pre-recorded audio (ประชุม, call log) |
จุดเด่น: ทำไมถึง "ฉลาด" กว่า STT ทั่วไป
1. แม่นยำสูง (WER ต่ำ)
| โหมด | WER |
|---|---|
| Streaming (real-time) | 4.0% |
| Non-streaming (pre-recorded) | 2.6% |
แปลว่า: ถอดเสียงผิดแค่ ~2.6 คำใน 100 คำ, ดีกว่า Chirp 3 (รุ่นก่อน) อย่างชัดเจน [1]
2. "ฉลาด" ในการถอดเสียง
| ความสามารถ | ตัวอย่าง |
|---|---|
| จัดการ self-correction | "เจอกันวันอังคาร... ไม่สิ วันพุธ" → ได้ "วันพุธ" |
| ตัด filler words | "อืม... เอ่อ..." → ตัดออกอัตโนมัติ |
| จัดรูปแบบอัตโนมัติ | ใส่ punctuation, ย่อหน้าให้เอง |
3. 85+ ภาษา + แยกผู้พูด
- ตรวจจับภาษาได้อัตโนมัติ 85+ ภาษา (รวมสำเนียงท้องถิ่น)
- แยกผู้พูดได้สูงสุด 3 คน (3+ คนยัง experimental)
ทำไมถึงสำคัญ: ตรงกับเทรนด์ voice AI
| เหตุผล | คำอธิบาย |
|---|---|
| Voice agent กำลังมา | STT แม่นยำ = พื้นฐานของ voice agent |
| ใช้ได้หลายงาน | caption, call analytics, voice command |
| เร็วขึ้น 70% | time-to-final-transcription ดีขึ้น 70% จาก Chirp 3 |
ข้อควรระวัง: มุมที่ต้องสมดุล
ก่อนสรุป ขอวางมุมให้ตรง:
| ข้อดี | ข้อควรระวัง |
|---|---|
| แม่นยำ + 85+ ภาษา | ยังเป็น public preview (ไม่ stable) |
| 2 API (streaming + batch) | 3+ speakers ยัง experimental |
| ใช้ในหลายผลิตภัณฑ์ Google | ต้องดูราคา/โควตา API |
สรุปมุมมองของผม
ผมมองว่า Gemini 3.5 Transcribe คือ "ก้าวสำคัญ" ของวงการ voice AI, เพราะมันแก้ "จุดอ่อน" ที่ STT ทั่วไปแพ้มาตลอด: เสียงรบกวน, ศัพท์เฉพาะ, การพูดติดขัด
และจุดที่ผมสนใจที่สุดคือ "smart transcription", การจัดการ self-correction ("วันอังคาร... ไม่สิ วันพุธ") และตัด filler words, เพราะนี่คือสิ่งที่ทำให้ "ถอดเสียง" กลายเป็น "ข้อความที่อ่านแล้วลื่น" ไม่ใช่ "ข้อความดิบที่ต้องมาแก้ทีหลัง"
และมันสอดคล้องกับสิ่งที่ผมเขียนเรื่อง podcast มาตลอด: STT ที่ดี คือ "ก้าวแรก" ของการทำ podcast → บทความ → คอนเทนต์, เพราะถ้าถอดเสียงได้แม่นยำ + แยกผู้พูดได้ งาน "แปลงเสียงเป็นข้อความ" จะง่ายขึ้นมหาศาล
คุณเคยใช้ STT ตัวไหนบ้างครับ? แล้วคิดว่า "smart transcription" (ตัด filler + จัด self-correction) สำคัญแค่ไหน? คอมเมนต์แลกเปลี่ยนกันได้ครับ
ถ้าชอบบทความแนว AI แบบนี้ ติดตาม Nokka ได้ที่ dev.to/sarantoon
แหล่งอ้างอิง
[1] Google. "Intelligent transcription with Gemini 3.5 Transcribe". 2026. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
[2] Google AI for Developers. "Gemini 3.5 Transcribe". 2026. https://ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe
บทความนี้วิเคราะห์จากประกาศของ Google ข้อมูล ณ 29 สิงหาคม 2026 Nokka

Top comments (0)