เปรียบเทียบ TTS ภาษาไทย 2026, ThonburianTTS, JaiTTS, F5-TTS-THAI, Qwen3-TTS, ตัวไหนดีที่สุดสำหรับคนไทย
โดย Nokka (นก-กา) | 13 สิงหาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา)
"AI พูดภาษาไทยได้ดีแค่ไหนในปี 2026?"
คำถามนี้สำคัญกว่าที่คิด, เพราะภาษาไทยไม่ได้มีเพียง "อีกหนึ่งภาษา" ใน multilingual model, ภาษาไทยมีวรรณยุกต์ 5 เสียง, สระประสม, ตัวสะกดไม่ตรงตามอักษร, และการออกเสียงที่ผิดเพียงนิดเดียวเปลี่ยนความหมายทั้งประโยค
ปี 2026 มี TTS ภาษาไทยให้เลือกหลายตัว, ตั้งแต่โมเดลที่พัฒนาโดยคนไทยโดยเฉพาะ ไปจนถึงโมเดล multilingual ขนาดใหญ่, บทความนี้จะเปรียบเทียบให้เห็นชัดๆ ว่าตัวไหนเหมาะกับงานแบบไหน
ภาพรวม, 4 โมเดล TTS ภาษาไทย
| โมเดล | ผู้พัฒนา | Stars | License | เทคนิค | Voice Cloning |
|---|---|---|---|---|---|
| ThonburianTTS | biodatlab (Mahidol + Looloo) | 63 | CC-BY-NC-SA + MIT | Flow Matching (F5-TTS) | ✅ Zero-shot |
| JaiTTS | SIIT + JTS | , (arXiv) | CC BY 4.0 | VoxCPM (tokenizer-free) | ✅ Zero-shot |
| F5-TTS-THAI | VYNCX | 155 | MIT | Flow Matching (F5-TTS) | ✅ Zero-shot |
| Qwen3-TTS | Alibaba (Qwen team) | 2,800+ | Apache 2.0 | Autoregressive + Diffusion | ✅ Zero-shot |
1. ThonburianTTS, ฝีมือคนไทย เพื่อคนไทย
GitHub: biodatlab/thonburian-tts, 63 ⭐, 20 forks, 35 commits
พัฒนาโดย biodatlab (ทีมวิจัยจาก Mahidol University ร่วมกับ Looloo Technology) — นำเสนอในงานประชุมวิชาการ iSAI-NLP 2025 — ThonburianTTS คือโมเดลที่ต่อยอดจาก F5-TTS และ E2-TTS — ออกแบบมาเพื่อแก้ปัญหาเฉพาะของภาษาไทย [1] [5]
จุดเด่น
| ฟีเจอร์ | รายละเอียด |
|---|---|
| Flow Matching | ใช้เทคนิค diffusion-based, สร้างเสียงที่ smooth และเป็นธรรมชาติ |
| Zero-shot Voice Cloning | ใช้เสียงตัวอย่างสั้นๆ, โคลนเสียงได้ทันที |
| ASR-TTS Integration | รองรับ interactive voice applications, พูด-ตอบ-พูด |
| Gradio Demo | มี WebUI ให้ลองใช้ผ่านเบราว์เซอร์ |
| Colab Notebook | รันบน Google Colab ได้, ไม่ต้องมี GPU แรง |
| ติดตั้งง่าย | pip install git+https://github.com/biodatlab/thonburian-tts.git |
ข้อจำกัด
| ข้อ | รายละเอียด |
|---|---|
| License | CC-BY-NC-SA, ห้ามใช้เชิงพาณิชย์ (ส่วน NC) |
| ข้อความยาว | เทรนบน GigaSpeech2 (utterance สั้น), อาจมีปัญหากับข้อความยาว |
| Stars น้อย | 63 stars, community เล็ก, อัปเดตช้า (commit ล่าสุด 6 เดือนก่อน) |
| GPU | ต้องใช้ GPU, แนะนำ CUDA |
| ข้อความยาวๆ | แต่อาจมีปัญหากับข้อความยาวๆ หรือบางคำยังไม่ถูกต้อง |
เหมาะกับ
- งานวิจัย, prototyping, งาน non-commercial
- คนที่ต้องการ TTS ไทยที่ออกเสียงถูกต้อง, มี paper รองรับ
- นักพัฒนาที่ต้องการทดลอง voice cloning ภาษาไทย
2. JaiTTS, น้องใหม่มาแรง CER ต่ำกว่ามนุษย์
arXiv: 2604.27607, CC BY 4.0, พัฒนาโดยทีมจาก SIIT (Sirindhorn International Institute of Technology) และ Jasmine Technology Solution (JTS) [2]
JaiTTS คือโมเดลที่สร้างความฮือฮาในวงการ TTS ไทย, เพราะ CER (Character Error Rate) 1.94%, ต่ำกว่ามนุษย์ (1.98%), หมายความว่าออกเสียงผิดน้อยกว่าคนอ่านจริงๆ
จุดเด่น
| ฟีเจอร์ | รายละเอียด |
|---|---|
| CER 1.94% | ต่ำกว่ามนุษย์ (1.98%), State-of-the-Art สำหรับภาษาไทย |
| Tokenizer-free | ไม่ต้องใช้ speech codec, ประมวลผล continuous speech latents โดยตรง |
| Thai-English Code-Switching | อ่านภาษาไทยปนอังกฤษได้, ไม่ต้อง text normalization |
| อ่านตัวเลขได้ | อ่านตัวเลขไทยโดยตรง, ไม่ต้องแปลงก่อน |
| RTF 0.1136 | สร้างเสียงเร็วกว่า real-time 9 เท่า |
| Human Evaluation | ชนะ commercial flagship 283/400 ครั้ง (70.75%), แพ้แค่ 58 ครั้ง |
| Long-form Speech | รองรับข้อความยาว 16-30 วินาที, ดีกว่า ThonburianTTS |
Architecture
JaiTTS ใช้สถาปัตยกรรม VoxCPM, แบ่งเป็น 4 โมดูล:
Text → TSLM (Text-Semantic Language Model) → FSQ → RALM → LocDiT → Speech
↑ ↑ ↑
MiniCPM-4 init Acoustic Diffusion
Refinement Decoder
- TSLM: วางแผน semantic + prosodic, เริ่มจาก MiniCPM-4
- FSQ: บีบอัดเป็น semi-discrete skeleton
- RALM: เพิ่ม speaker similarity + acoustic detail
- LocDiT: Diffusion Transformer, ถอดรหัสเป็นเสียง
ข้อจำกัด
| ข้อ | รายละเอียด |
|---|---|
| ยังไม่มี public repo | ณ ส.ค. 2026, ยังไม่มี GitHub repo สาธารณะ, มีแค่ paper |
| ยังไม่มี demo | ไม่มี Gradio/HuggingFace Space ให้ลอง |
| License | CC BY 4.0, ใช้เชิงพาณิชย์ได้ แต่ต้องให้ credit |
| ใหม่มาก | arXiv เม.ย. 2026, ยังไม่มี community adoption |
เหมาะกับ
- งานที่ต้องการความถูกต้องสูง, อ่านตัวเลข, code-switching
- งาน commercial (CC BY 4.0)
- งาน long-form speech (16-30 วินาที)
- แต่ต้องรอ public release ก่อน
3. F5-TTS-THAI, ชุมชนใหญ่ที่สุด ติดตั้งง่ายที่สุด
GitHub: VYNCX/F5-TTS-THAI, 155 ⭐, 49 forks, MIT license [3]
F5-TTS-THAI คือการ finetune F5-TTS บนข้อมูลภาษาไทย, มี 2 เวอร์ชัน, community ใหญ่ที่สุดในกลุ่ม TTS ไทย
จุดเด่น
| ฟีเจอร์ | รายละเอียด |
|---|---|
| 2 เวอร์ชัน | v1 (ออกเสียงไทยดีกว่า) / v2 (IPA, ลดคำซ้ำ/ข้าม) |
| ติดตั้งง่าย | pip install f5-tts-th |
| WebUI | Gradio, app-webui.bat, คลิกเดียวใช้ได้ |
| Finetune | มี Colab notebook สำหรับเทรนต่อ |
| MIT License | ใช้เชิงพาณิชย์ได้, ไม่มีข้อจำกัด |
| Community | 155 stars, ใหญ่ที่สุด, มีคนใช้เยอะ |
ข้อจำกัด
| ข้อ | รายละเอียด |
|---|---|
| ข้อความยาว | อ่านข้อความยาวๆ หรือบางคำยังไม่ถูกต้อง |
| คำเฉพาะ | ตัวเลข, ชื่ออังกฤษ, คำเฉพาะ, ควรทดสอบก่อน |
| GPU | แนะนำ CUDA 11.8 |
เหมาะกับ
- นักพัฒนาที่ต้องการเริ่มต้นเร็ว, MIT license
- งาน commercial, ไม่มีข้อจำกัด license
- คนที่ต้องการ WebUI ง่ายๆ
4. Qwen3-TTS, ยักษ์ใหญ่จาก Alibaba
GitHub: QwenLM/Qwen3-TTS, 2,800+ ⭐, Apache 2.0 [4]
Qwen3-TTS คือโมเดล TTS ขนาดใหญ่จาก Alibaba, รองรับ 10 ภาษา, อย่างไรก็ตาม, ด้วยขนาดและความสามารถ, อาจออกเสียงไทยได้บ้างจาก multilingual training
จุดเด่น
| ฟีเจอร์ | รายละเอียด |
|---|---|
| ขนาดใหญ่ | 0.6B และ 1.7B parameters |
| 10 ภาษา | จีน, อังกฤษ, ญี่ปุ่น, เกาหลี, ฝรั่งเศส, เยอรมัน, สเปน, โปรตุเกส, อิตาลี, รัสเซีย |
| Voice Design | ออกแบบเสียงเองได้, ไม่ต้องใช้ reference |
| Streaming | รองรับ streaming, latency ต่ำ |
| Apache 2.0 | ใช้เชิงพาณิชย์ได้เต็มที่ |
| Community ใหญ่ | 2,800+ stars, Alibaba support |
ข้อจำกัดสำหรับภาษาไทย
| ข้อ | รายละเอียด |
|---|---|
| ไม่รองรับไทยอย่างเป็นทางการ | ไทยไม่อยู่ใน 10 ภาษา, อาจออกเสียงผิด |
| วรรณยุกต์ | ไม่ได้ออกแบบมาสำหรับ tonal language, เสียงอาจเพี้ยน |
| Code-switching | ไทยปนอังกฤษ, ไม่รับประกัน |
| ขนาดใหญ่ | 1.7B, ต้องใช้ GPU แรง |
เหมาะกับ
- งาน multilingual, ที่ภาษาไทยเป็นส่วนน้อย
- งานที่ต้องการ voice design, ไม่ได้มีเพียง cloning
- งาน streaming, latency สำคัญ
เปรียบเทียบแบบตัวต่อตัว
| เกณฑ์ | ThonburianTTS | JaiTTS | F5-TTS-THAI | Qwen3-TTS |
|---|---|---|---|---|
| ออกเสียงไทย | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐ |
| Voice Cloning | ✅ | ✅ | ✅ | ✅ |
| Code-Switching | ❌ | ✅ | ❌ | ❌ |
| อ่านตัวเลข | ❌ | ✅ | ❌ | ❌ |
| Long-form | ❌ | ✅ | ❌ | ✅ |
| ความเร็ว | ปานกลาง | 9x real-time | ปานกลาง | เร็ว (streaming) |
| ติดตั้งง่าย | ⭐⭐⭐ | (ยังไม่มี) | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| License เชิงพาณิชย์ | ❌ (NC) | ✅ (CC BY) | ✅ (MIT) | ✅ (Apache 2.0) |
| Community | เล็ก | ยังไม่มี | กลาง | ใหญ่ |
| Paper | ✅ iSAI-NLP 2025 | ✅ arXiv 2026 | ❌ | ✅ |
| CER | 1.94% |
🎯 คำแนะนำ, เลือกตัวไหนดี
| สถานการณ์ | แนะนำ | เพราะ |
|---|---|---|
| อยากได้ความถูกต้องสูงสุด, อ่านตัวเลข, ไทยปนอังกฤษ | JaiTTS | CER 1.94%, ต่ำกว่ามนุษย์, code-switching, แต่ต้องรอ public release |
| อยากเริ่มวันนี้, ใช้เชิงพาณิชย์, ติดตั้งง่าย | F5-TTS-THAI | MIT license, pip install, WebUI, community ใหญ่ |
| งานวิจัย, non-commercial, ต้องการ paper รองรับ | ThonburianTTS | Paper iSAI-NLP, ออกแบบเพื่อไทย, แต่ license NC |
| งาน multilingual, ไทยเป็นส่วนน้อย, ต้องการ voice design | Qwen3-TTS | 10 ภาษา, voice design, streaming, แต่ไทยไม่ใช่ภาษาหลัก |
| อยากได้เสียงธรรมชาติที่สุด, ไม่สนใจ local | ElevenLabs | รองรับไทย, คุณภาพสูงสุด, แต่ cloud เท่านั้น |
ข้อควรระวัง
1. JaiTTS ยังไม่มี public release
ณ สิงหาคม 2026, JaiTTS มีแค่ paper บน arXiv, ยังไม่มี GitHub repo, HuggingFace model, หรือ demo สาธารณะ, ถ้าต้องการใช้ตอนนี้, ต้องรอ
2. License คือตัวตัดสิน
- F5-TTS-THAI (MIT), ใช้ทำอะไรก็ได้, ขายได้, ไม่ต้องขอ
- JaiTTS (CC BY 4.0), ใช้เชิงพาณิชย์ได้, แต่ต้องให้ credit
- ThonburianTTS (CC-BY-NC-SA), ห้ามใช้เชิงพาณิชย์, ห้ามดัดแปลงโดยไม่เปิดซอร์ส
- Qwen3-TTS (Apache 2.0), ใช้ได้เต็มที่, แต่ไทยไม่ใช่ภาษาหลัก
3. ภาษาไทย ≠ "อีกหนึ่งภาษา"
Multilingual models (เช่น Qwen3-TTS) อาจ "รองรับ" ภาษาไทย, แต่การออกเสียงวรรณยุกต์, สระประสม, ตัวสะกด, ต้องการการเทรนเฉพาะ, โมเดลที่ออกแบบเพื่อไทยโดยเฉพาะ (ThonburianTTS, JaiTTS) จะให้ผลลัพธ์ที่ดีกว่ามาก
4. Code-Switching คือตัวเปลี่ยนเกม
ในชีวิตจริง, คนไทยพูดไทยปนอังกฤษตลอดเวลา, "ไปเซ็นทรัลเวิลด์, เจอกันชั้น G, เอา Frappuccino แก้วนึง", โมเดลที่อ่าน code-switching ได้ (JaiTTS) จะใช้งานได้จริงมากกว่าโมเดลที่อ่านได้แต่ไทยล้วน
สรุป
| คำถาม | คำตอบ |
|---|---|
| TTS ไทยตัวไหนดีที่สุด? | JaiTTS (CER 1.94%), แต่ยังไม่มี public release |
| ตัวไหนใช้ได้วันนี้? | F5-TTS-THAI, MIT license, ติดตั้งง่าย |
| ตัวไหนมี paper รองรับ? | ThonburianTTS (iSAI-NLP 2025) + JaiTTS (arXiv 2026) |
| ตัวไหนใช้เชิงพาณิชย์ได้? | F5-TTS-THAI (MIT), JaiTTS (CC BY), Qwen3-TTS (Apache 2.0) |
| Qwen3-TTS ใช้กับไทยได้ไหม? | ไม่แนะนำ, ไทยไม่อยู่ใน 10 ภาษาที่รองรับ |
| ElevenLabs ยังดีที่สุดไหม? | ด้านคุณภาพ, ใช่, แต่ cloud เท่านั้น, ไม่ local |
Bottom line: ปี 2026 คือปีทองของ TTS ภาษาไทย, จากที่เคยมีแค่ ElevenLabs (cloud), ตอนนี้มี open-source ให้เลือก 3-4 ตัว, JaiTTS คือความหวังใหม่ด้วย CER ที่ต่ำกว่ามนุษย์, แต่ถ้าอยากเริ่มวันนี้, F5-TTS-THAI คือคำตอบ, MIT license, pip install, จบใน 5 นาที
แหล่งอ้างอิง
[1] biodatlab. "ThonburianTTS, Thai TTS based on F5-TTS and E2-TTS". GitHub. 2025. https://github.com/biodatlab/thonburian-tts
[2] Karnjanaekarin et al. "JaiTTS: A Thai Voice Cloning Model". arXiv. 2026. https://arxiv.org/abs/2604.27607
[3] VYNCX. "F5-TTS-THAI". GitHub. 2025. https://github.com/VYNCX/F5-TTS-THAI
[4] QwenLM. "Qwen3-TTS, Open-source TTS series". GitHub. 2026. https://github.com/QwenLM/Qwen3-TTS
[5] Aung et al. "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech". iSAI-NLP. 2025. https://ieeexplore.ieee.org/document/11320472
บทความนี้วิเคราะห์จาก GitHub repos, arXiv papers, HuggingFace model cards, และแหล่งข้อมูลเพิ่มเติม, ข้อมูล ณ 13 สิงหาคม 2026, Nokka
ในมุมมองของผม, JaiTTS คือตัวที่น่าจับตามองที่สุด, CER 1.94% ต่ำกว่ามนุษย์, code-switching, tokenizer-free, แต่การที่ยังไม่มี public release เป็นข้อจำกัดใหญ่, ถ้าทีม JTS เปิดซอร์สเมื่อไหร่, นั่นคือวันที่ TTS ไทยเปลี่ยนไปตลอดกาล, ส่วน F5-TTS-THAI คือ "ของที่ใช้ได้จริงวันนี้", MIT license, community ใหญ่, ติดตั้งง่าย, ถ้าคุณต้องการ TTS ไทยสำหรับงาน commercial, เริ่มที่ F5-TTS-THAI, แล้วรอ JaiTTS
คุณใช้ TTS ไทยตัวไหนอยู่? หรือกำลังมองหาตัวใหม่? เจอปัญหาอะไรบ้าง? แชร์ประสบการณ์ใต้บทความได้เลยครับ


Top comments (0)