DEV Community

Nokka
Nokka

Posted on

เปรียบเทียบ TTS ภาษาไทย 2026, ThonburianTTS, JaiTTS, F5-TTS-THAI, Qwen3-TTS, ตัวไหนดีที่สุดสำหรับคนไทย

เปรียบเทียบ TTS ภาษาไทย 2026, ThonburianTTS, JaiTTS, F5-TTS-THAI, Qwen3-TTS, ตัวไหนดีที่สุดสำหรับคนไทย

โดย Nokka (นก-กา) | 13 สิงหาคม 2026

บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา)


"AI พูดภาษาไทยได้ดีแค่ไหนในปี 2026?"

คำถามนี้สำคัญกว่าที่คิด, เพราะภาษาไทยไม่ได้มีเพียง "อีกหนึ่งภาษา" ใน multilingual model, ภาษาไทยมีวรรณยุกต์ 5 เสียง, สระประสม, ตัวสะกดไม่ตรงตามอักษร, และการออกเสียงที่ผิดเพียงนิดเดียวเปลี่ยนความหมายทั้งประโยค

ปี 2026 มี TTS ภาษาไทยให้เลือกหลายตัว, ตั้งแต่โมเดลที่พัฒนาโดยคนไทยโดยเฉพาะ ไปจนถึงโมเดล multilingual ขนาดใหญ่, บทความนี้จะเปรียบเทียบให้เห็นชัดๆ ว่าตัวไหนเหมาะกับงานแบบไหน


ภาพรวม, 4 โมเดล TTS ภาษาไทย

โมเดล ผู้พัฒนา Stars License เทคนิค Voice Cloning
ThonburianTTS biodatlab (Mahidol + Looloo) 63 CC-BY-NC-SA + MIT Flow Matching (F5-TTS) ✅ Zero-shot
JaiTTS SIIT + JTS , (arXiv) CC BY 4.0 VoxCPM (tokenizer-free) ✅ Zero-shot
F5-TTS-THAI VYNCX 155 MIT Flow Matching (F5-TTS) ✅ Zero-shot
Qwen3-TTS Alibaba (Qwen team) 2,800+ Apache 2.0 Autoregressive + Diffusion ✅ Zero-shot

Thai TTS Models Comparison 2026 — 4 โมเดลเทียบกัน


1. ThonburianTTS, ฝีมือคนไทย เพื่อคนไทย

GitHub: biodatlab/thonburian-tts, 63 ⭐, 20 forks, 35 commits

พัฒนาโดย biodatlab (ทีมวิจัยจาก Mahidol University ร่วมกับ Looloo Technology) — นำเสนอในงานประชุมวิชาการ iSAI-NLP 2025 — ThonburianTTS คือโมเดลที่ต่อยอดจาก F5-TTS และ E2-TTS — ออกแบบมาเพื่อแก้ปัญหาเฉพาะของภาษาไทย [1] [5]

จุดเด่น

ฟีเจอร์ รายละเอียด
Flow Matching ใช้เทคนิค diffusion-based, สร้างเสียงที่ smooth และเป็นธรรมชาติ
Zero-shot Voice Cloning ใช้เสียงตัวอย่างสั้นๆ, โคลนเสียงได้ทันที
ASR-TTS Integration รองรับ interactive voice applications, พูด-ตอบ-พูด
Gradio Demo มี WebUI ให้ลองใช้ผ่านเบราว์เซอร์
Colab Notebook รันบน Google Colab ได้, ไม่ต้องมี GPU แรง
ติดตั้งง่าย pip install git+https://github.com/biodatlab/thonburian-tts.git

ข้อจำกัด

ข้อ รายละเอียด
License CC-BY-NC-SA, ห้ามใช้เชิงพาณิชย์ (ส่วน NC)
ข้อความยาว เทรนบน GigaSpeech2 (utterance สั้น), อาจมีปัญหากับข้อความยาว
Stars น้อย 63 stars, community เล็ก, อัปเดตช้า (commit ล่าสุด 6 เดือนก่อน)
GPU ต้องใช้ GPU, แนะนำ CUDA
ข้อความยาวๆ แต่อาจมีปัญหากับข้อความยาวๆ หรือบางคำยังไม่ถูกต้อง

เหมาะกับ

  • งานวิจัย, prototyping, งาน non-commercial
  • คนที่ต้องการ TTS ไทยที่ออกเสียงถูกต้อง, มี paper รองรับ
  • นักพัฒนาที่ต้องการทดลอง voice cloning ภาษาไทย

2. JaiTTS, น้องใหม่มาแรง CER ต่ำกว่ามนุษย์

arXiv: 2604.27607, CC BY 4.0, พัฒนาโดยทีมจาก SIIT (Sirindhorn International Institute of Technology) และ Jasmine Technology Solution (JTS) [2]

JaiTTS คือโมเดลที่สร้างความฮือฮาในวงการ TTS ไทย, เพราะ CER (Character Error Rate) 1.94%, ต่ำกว่ามนุษย์ (1.98%), หมายความว่าออกเสียงผิดน้อยกว่าคนอ่านจริงๆ

จุดเด่น

ฟีเจอร์ รายละเอียด
CER 1.94% ต่ำกว่ามนุษย์ (1.98%), State-of-the-Art สำหรับภาษาไทย
Tokenizer-free ไม่ต้องใช้ speech codec, ประมวลผล continuous speech latents โดยตรง
Thai-English Code-Switching อ่านภาษาไทยปนอังกฤษได้, ไม่ต้อง text normalization
อ่านตัวเลขได้ อ่านตัวเลขไทยโดยตรง, ไม่ต้องแปลงก่อน
RTF 0.1136 สร้างเสียงเร็วกว่า real-time 9 เท่า
Human Evaluation ชนะ commercial flagship 283/400 ครั้ง (70.75%), แพ้แค่ 58 ครั้ง
Long-form Speech รองรับข้อความยาว 16-30 วินาที, ดีกว่า ThonburianTTS

Architecture

How TTS Works — หลักการทำงาน Text-to-Speech

JaiTTS ใช้สถาปัตยกรรม VoxCPM, แบ่งเป็น 4 โมดูล:

Text → TSLM (Text-Semantic Language Model) → FSQ → RALM → LocDiT → Speech
         ↑                                        ↑        ↑
    MiniCPM-4 init                          Acoustic    Diffusion
                                           Refinement   Decoder
Enter fullscreen mode Exit fullscreen mode
  • TSLM: วางแผน semantic + prosodic, เริ่มจาก MiniCPM-4
  • FSQ: บีบอัดเป็น semi-discrete skeleton
  • RALM: เพิ่ม speaker similarity + acoustic detail
  • LocDiT: Diffusion Transformer, ถอดรหัสเป็นเสียง

ข้อจำกัด

ข้อ รายละเอียด
ยังไม่มี public repo ณ ส.ค. 2026, ยังไม่มี GitHub repo สาธารณะ, มีแค่ paper
ยังไม่มี demo ไม่มี Gradio/HuggingFace Space ให้ลอง
License CC BY 4.0, ใช้เชิงพาณิชย์ได้ แต่ต้องให้ credit
ใหม่มาก arXiv เม.ย. 2026, ยังไม่มี community adoption

เหมาะกับ

  • งานที่ต้องการความถูกต้องสูง, อ่านตัวเลข, code-switching
  • งาน commercial (CC BY 4.0)
  • งาน long-form speech (16-30 วินาที)
  • แต่ต้องรอ public release ก่อน

3. F5-TTS-THAI, ชุมชนใหญ่ที่สุด ติดตั้งง่ายที่สุด

GitHub: VYNCX/F5-TTS-THAI, 155 ⭐, 49 forks, MIT license [3]

F5-TTS-THAI คือการ finetune F5-TTS บนข้อมูลภาษาไทย, มี 2 เวอร์ชัน, community ใหญ่ที่สุดในกลุ่ม TTS ไทย

จุดเด่น

ฟีเจอร์ รายละเอียด
2 เวอร์ชัน v1 (ออกเสียงไทยดีกว่า) / v2 (IPA, ลดคำซ้ำ/ข้าม)
ติดตั้งง่าย pip install f5-tts-th
WebUI Gradio, app-webui.bat, คลิกเดียวใช้ได้
Finetune มี Colab notebook สำหรับเทรนต่อ
MIT License ใช้เชิงพาณิชย์ได้, ไม่มีข้อจำกัด
Community 155 stars, ใหญ่ที่สุด, มีคนใช้เยอะ

ข้อจำกัด

ข้อ รายละเอียด
ข้อความยาว อ่านข้อความยาวๆ หรือบางคำยังไม่ถูกต้อง
คำเฉพาะ ตัวเลข, ชื่ออังกฤษ, คำเฉพาะ, ควรทดสอบก่อน
GPU แนะนำ CUDA 11.8

เหมาะกับ

  • นักพัฒนาที่ต้องการเริ่มต้นเร็ว, MIT license
  • งาน commercial, ไม่มีข้อจำกัด license
  • คนที่ต้องการ WebUI ง่ายๆ

4. Qwen3-TTS, ยักษ์ใหญ่จาก Alibaba

GitHub: QwenLM/Qwen3-TTS, 2,800+ ⭐, Apache 2.0 [4]

Qwen3-TTS คือโมเดล TTS ขนาดใหญ่จาก Alibaba, รองรับ 10 ภาษา, อย่างไรก็ตาม, ด้วยขนาดและความสามารถ, อาจออกเสียงไทยได้บ้างจาก multilingual training

จุดเด่น

ฟีเจอร์ รายละเอียด
ขนาดใหญ่ 0.6B และ 1.7B parameters
10 ภาษา จีน, อังกฤษ, ญี่ปุ่น, เกาหลี, ฝรั่งเศส, เยอรมัน, สเปน, โปรตุเกส, อิตาลี, รัสเซีย
Voice Design ออกแบบเสียงเองได้, ไม่ต้องใช้ reference
Streaming รองรับ streaming, latency ต่ำ
Apache 2.0 ใช้เชิงพาณิชย์ได้เต็มที่
Community ใหญ่ 2,800+ stars, Alibaba support

ข้อจำกัดสำหรับภาษาไทย

ข้อ รายละเอียด
ไม่รองรับไทยอย่างเป็นทางการ ไทยไม่อยู่ใน 10 ภาษา, อาจออกเสียงผิด
วรรณยุกต์ ไม่ได้ออกแบบมาสำหรับ tonal language, เสียงอาจเพี้ยน
Code-switching ไทยปนอังกฤษ, ไม่รับประกัน
ขนาดใหญ่ 1.7B, ต้องใช้ GPU แรง

เหมาะกับ

  • งาน multilingual, ที่ภาษาไทยเป็นส่วนน้อย
  • งานที่ต้องการ voice design, ไม่ได้มีเพียง cloning
  • งาน streaming, latency สำคัญ

เปรียบเทียบแบบตัวต่อตัว

เกณฑ์ ThonburianTTS JaiTTS F5-TTS-THAI Qwen3-TTS
ออกเสียงไทย ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐
Voice Cloning
Code-Switching
อ่านตัวเลข
Long-form
ความเร็ว ปานกลาง 9x real-time ปานกลาง เร็ว (streaming)
ติดตั้งง่าย ⭐⭐⭐ (ยังไม่มี) ⭐⭐⭐⭐⭐ ⭐⭐⭐
License เชิงพาณิชย์ ❌ (NC) ✅ (CC BY) ✅ (MIT) ✅ (Apache 2.0)
Community เล็ก ยังไม่มี กลาง ใหญ่
Paper ✅ iSAI-NLP 2025 ✅ arXiv 2026
CER 1.94%

🎯 คำแนะนำ, เลือกตัวไหนดี

สถานการณ์ แนะนำ เพราะ
อยากได้ความถูกต้องสูงสุด, อ่านตัวเลข, ไทยปนอังกฤษ JaiTTS CER 1.94%, ต่ำกว่ามนุษย์, code-switching, แต่ต้องรอ public release
อยากเริ่มวันนี้, ใช้เชิงพาณิชย์, ติดตั้งง่าย F5-TTS-THAI MIT license, pip install, WebUI, community ใหญ่
งานวิจัย, non-commercial, ต้องการ paper รองรับ ThonburianTTS Paper iSAI-NLP, ออกแบบเพื่อไทย, แต่ license NC
งาน multilingual, ไทยเป็นส่วนน้อย, ต้องการ voice design Qwen3-TTS 10 ภาษา, voice design, streaming, แต่ไทยไม่ใช่ภาษาหลัก
อยากได้เสียงธรรมชาติที่สุด, ไม่สนใจ local ElevenLabs รองรับไทย, คุณภาพสูงสุด, แต่ cloud เท่านั้น

ข้อควรระวัง

1. JaiTTS ยังไม่มี public release

ณ สิงหาคม 2026, JaiTTS มีแค่ paper บน arXiv, ยังไม่มี GitHub repo, HuggingFace model, หรือ demo สาธารณะ, ถ้าต้องการใช้ตอนนี้, ต้องรอ

2. License คือตัวตัดสิน

  • F5-TTS-THAI (MIT), ใช้ทำอะไรก็ได้, ขายได้, ไม่ต้องขอ
  • JaiTTS (CC BY 4.0), ใช้เชิงพาณิชย์ได้, แต่ต้องให้ credit
  • ThonburianTTS (CC-BY-NC-SA), ห้ามใช้เชิงพาณิชย์, ห้ามดัดแปลงโดยไม่เปิดซอร์ส
  • Qwen3-TTS (Apache 2.0), ใช้ได้เต็มที่, แต่ไทยไม่ใช่ภาษาหลัก

3. ภาษาไทย ≠ "อีกหนึ่งภาษา"

Multilingual models (เช่น Qwen3-TTS) อาจ "รองรับ" ภาษาไทย, แต่การออกเสียงวรรณยุกต์, สระประสม, ตัวสะกด, ต้องการการเทรนเฉพาะ, โมเดลที่ออกแบบเพื่อไทยโดยเฉพาะ (ThonburianTTS, JaiTTS) จะให้ผลลัพธ์ที่ดีกว่ามาก

4. Code-Switching คือตัวเปลี่ยนเกม

ในชีวิตจริง, คนไทยพูดไทยปนอังกฤษตลอดเวลา, "ไปเซ็นทรัลเวิลด์, เจอกันชั้น G, เอา Frappuccino แก้วนึง", โมเดลที่อ่าน code-switching ได้ (JaiTTS) จะใช้งานได้จริงมากกว่าโมเดลที่อ่านได้แต่ไทยล้วน


สรุป

คำถาม คำตอบ
TTS ไทยตัวไหนดีที่สุด? JaiTTS (CER 1.94%), แต่ยังไม่มี public release
ตัวไหนใช้ได้วันนี้? F5-TTS-THAI, MIT license, ติดตั้งง่าย
ตัวไหนมี paper รองรับ? ThonburianTTS (iSAI-NLP 2025) + JaiTTS (arXiv 2026)
ตัวไหนใช้เชิงพาณิชย์ได้? F5-TTS-THAI (MIT), JaiTTS (CC BY), Qwen3-TTS (Apache 2.0)
Qwen3-TTS ใช้กับไทยได้ไหม? ไม่แนะนำ, ไทยไม่อยู่ใน 10 ภาษาที่รองรับ
ElevenLabs ยังดีที่สุดไหม? ด้านคุณภาพ, ใช่, แต่ cloud เท่านั้น, ไม่ local

Bottom line: ปี 2026 คือปีทองของ TTS ภาษาไทย, จากที่เคยมีแค่ ElevenLabs (cloud), ตอนนี้มี open-source ให้เลือก 3-4 ตัว, JaiTTS คือความหวังใหม่ด้วย CER ที่ต่ำกว่ามนุษย์, แต่ถ้าอยากเริ่มวันนี้, F5-TTS-THAI คือคำตอบ, MIT license, pip install, จบใน 5 นาที


แหล่งอ้างอิง

[1] biodatlab. "ThonburianTTS, Thai TTS based on F5-TTS and E2-TTS". GitHub. 2025. https://github.com/biodatlab/thonburian-tts

[2] Karnjanaekarin et al. "JaiTTS: A Thai Voice Cloning Model". arXiv. 2026. https://arxiv.org/abs/2604.27607

[3] VYNCX. "F5-TTS-THAI". GitHub. 2025. https://github.com/VYNCX/F5-TTS-THAI

[4] QwenLM. "Qwen3-TTS, Open-source TTS series". GitHub. 2026. https://github.com/QwenLM/Qwen3-TTS

[5] Aung et al. "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech". iSAI-NLP. 2025. https://ieeexplore.ieee.org/document/11320472


บทความนี้วิเคราะห์จาก GitHub repos, arXiv papers, HuggingFace model cards, และแหล่งข้อมูลเพิ่มเติม, ข้อมูล ณ 13 สิงหาคม 2026, Nokka

ในมุมมองของผม, JaiTTS คือตัวที่น่าจับตามองที่สุด, CER 1.94% ต่ำกว่ามนุษย์, code-switching, tokenizer-free, แต่การที่ยังไม่มี public release เป็นข้อจำกัดใหญ่, ถ้าทีม JTS เปิดซอร์สเมื่อไหร่, นั่นคือวันที่ TTS ไทยเปลี่ยนไปตลอดกาล, ส่วน F5-TTS-THAI คือ "ของที่ใช้ได้จริงวันนี้", MIT license, community ใหญ่, ติดตั้งง่าย, ถ้าคุณต้องการ TTS ไทยสำหรับงาน commercial, เริ่มที่ F5-TTS-THAI, แล้วรอ JaiTTS

คุณใช้ TTS ไทยตัวไหนอยู่? หรือกำลังมองหาตัวใหม่? เจอปัญหาอะไรบ้าง? แชร์ประสบการณ์ใต้บทความได้เลยครับ

Top comments (0)