ThonburianTTS — AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย
โดย Nokka (นก-กา) | 8 สิงหาคม 2569
บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ — Nokka (นก-กา)
ถ้าคุณกำลังมองหา Text-to-Speech ภาษาไทยที่รันในเครื่องตัวเองได้ ไม่ต้องเสียค่า API และฟังดูเป็นธรรมชาติ — ThonburianTTS คือคำตอบที่น่าสนใจที่สุดในตอนนี้
พัฒนาโดยทีมวิจัยจาก Mahidol University ร่วมกับ Looloo Technology โมเดลนี้ถูกนำเสนอในงานประชุมวิชาการ iSAI-NLP 2025 และเปิดให้ใช้ฟรีบน HuggingFace กับ GitHub [1][2]
บทความนี้จะพาไปดูว่า ThonburianTTS คืออะไร ใช้ทำอะไรได้บ้าง ข้อดีข้อเสีย และเหมาะกับใคร
ThonburianTTS คืออะไร
ThonburianTTS เป็น Text-to-Speech ภาษาไทยที่พัฒนาต่อยอดจาก F5-TTS (Flow Matching) สถาปัตยกรรมที่ใช้เทคนิค diffusion-based flow matching เพื่อสร้างเสียงพูดที่เป็นธรรมชาติ [1]
จุดเด่นที่ทำให้ ThonburianTTS แตกต่างจาก TTS ทั่วไป:
| คุณสมบัติ | รายละเอียด |
|---|---|
| ภาษา | ภาษาไทยเป็นหลัก (รองรับทั้ง Thai script และ IPA) |
| Voice Cloning | Zero-shot — ใช้เสียงตัวอย่างสั้นๆ (5-10 วินาที) เพื่อเลียนแบบเสียง |
| การรัน | Local — รันบนเครื่องตัวเองได้ทั้ง GPU และ CPU |
| ขนาดโมเดล | ~1.35 GB (ประมาณ 500M parameters) |
| License | โค้ด MIT, โมเดล CC BY-NC-SA 4.0 (ห้ามใช้เชิงพาณิชย์) |
| ผู้พัฒนา | Biomedical and Data Lab, Mahidol University + Looloo Technology |
ใช้ทำอะไรได้บ้าง
ThonburianTTS เหมาะกับงานที่ต้องการเสียงพูดภาษาไทยที่เป็นธรรมชาติ โดยไม่ต้องพึ่ง API ภายนอก [1]:
- ระบบพากย์เสียงภาษาไทย — พากย์วิดีโอ, สื่อการสอน, audiobook
- AI Voice Bot ภาษาไทย — ทำ chatbot ที่พูดภาษาไทยได้
- Voice Cloning ส่วนตัว — โคลนเสียงตัวเองหรือเสียงคนในทีม
- ระบบอ่านข้อความภาษาไทย — อ่านบทความ, ข่าว, เอกสาร
- งานวิจัยและพัฒนา — ต่อยอด TTS ภาษาไทยในเชิงวิชาการ
จุดเด่นที่ทำให้ ThonburianTTS น่าสนใจ
1. เสียงภาษาไทยที่เป็นธรรมชาติ
ThonburianTTS ถูก fine-tune บนข้อมูลภาษาไทยโดยเฉพาะ (GigaSpeech2) ทำให้ออกเสียงภาษาไทยได้ถูกต้องและเป็นธรรมชาติกว่าโมเดล multilingual ทั่วไป [1][3]
ผู้ใช้หลายคนรายงานว่า ThonburianTTS ให้เสียงภาษาไทยที่ดีกว่า Qwen-TTS และ OmniVoice ซึ่งเป็นโมเดล multilingual ที่ไม่ได้ optimize สำหรับภาษาไทย
2. Voice Cloning แบบ Zero-Shot
ใช้เสียงตัวอย่างสั้นๆ เพียง 5-10 วินาที ก็สามารถเลียนแบบเสียงต้นฉบับได้ โดยงานวิจัยต้นฉบับรายงาน similarity scores ที่ 84-89% [4]
3. รันในเครื่องได้ ไม่ต้องพึ่ง Cloud
ติดตั้งผ่าน pip คำสั่งเดียว:
pip install git+https://github.com/biodatlab/thonburian-tts.git
ใช้ GPU (NVIDIA CUDA) หรือ CPU ก็ได้ — GPU จะเร็วกว่า แต่ CPU ก็รันได้ (ช้ากว่า) [1]
4. ปรับแต่งได้
- ปรับความเร็วเสียง (speed control)
- ตัดช่วงเงียบ (silence trimming)
- รักษาสไตล์เสียงต้นฉบับ (voice style preservation)
5. มี Gradio Demo ให้ลองใช้
ทีมพัฒนาทำ Gradio Web UI ให้ลองใช้ผ่าน HuggingFace Spaces ได้ทันที โดยไม่ต้องติดตั้งอะไร [1]
ข้อจำกัดที่ควรรู้
1. ไม่เหมาะกับข้อความยาว
งานวิจัย JaiTTS (2026) ระบุว่า ThonburianTTS "fails to generate sensible output" สำหรับข้อความยาว เพราะถูกเทรนบน GigaSpeech2 ซึ่งเป็นชุดข้อมูลที่เน้น utterances สั้นๆ [3]
2. Zero-shot cloning ยังมีข้อจำกัด
ถึงแม้ similarity scores จะสูง (84-89%) แต่ JaiTTS paper ระบุว่า ThonburianTTS ยังมีข้อจำกัดด้าน zero-shot speaker cloning เมื่อเทียบกับโมเดลที่ใหม่กว่า [3]
3. License ห้ามใช้เชิงพาณิชย์
- โค้ด: MIT (ใช้ได้อิสระ)
- โมเดล: CC BY-NC-SA 4.0 — ห้ามใช้ในเชิงพาณิชย์ ถ้าจะใช้ต้องขออนุญาตจากทีมพัฒนา [1]
4. ต้องการ VRAM ~2-3 GB
F5-TTS ต้องการ VRAM ประมาณ 2-3 GB สำหรับ inference — ถ้าใช้ CPU จะช้ากว่ามาก [5]
เปรียบเทียบกับโมเดลอื่น
| โมเดล | ภาษา | Voice Cloning | License | ขนาด | จุดเด่น |
|---|---|---|---|---|---|
| ThonburianTTS | ไทย (หลัก) | ✅ Zero-shot | CC BY-NC-SA 4.0 | ~1.35 GB | เสียงไทยธรรมชาติ, รัน local |
| Qwen-TTS | หลายภาษา | ✅ | Apache 2.0 | 0.6B-1.7B | หลายภาษา, แข็งแกร่ง |
| OmniVoice | หลายภาษา | ✅ | แตกต่างตามรุ่น | แตกต่าง | Voice cloning คุณภาพดี |
| JaiTTS | ไทย (หลัก) | ✅ | CC BY 4.0 | ใหญ่กว่า | ข้อความยาวได้, CER 1.94% |
สรุป: ThonburianTTS เหนือกว่าสำหรับงานภาษาไทยที่ต้องการความ natural และรัน local ได้ แต่ถ้าต้องการข้อความยาวหรือใช้เชิงพาณิชย์ ควรพิจารณา JaiTTS หรือ Qwen-TTS แทน
เหมาะกับใคร
เหมาะกับ
- นักพัฒนาไทย ที่อยากทำระบบ TTS ภาษาไทยโดยไม่เสียค่า API
- นักวิจัย ที่ต้องการต่อยอด TTS ภาษาไทย
- ผู้ใช้ทั่วไป ที่อยากลอง voice cloning ภาษาไทย
- งาน non-commercial — งานวิจัย, โปรเจกต์ส่วนตัว, งานอดิเรก
เหมาะน้อยกว่า
- งานเชิงพาณิชย์ — ต้องขอ license เพิ่มเติม
- ข้อความยาว — ยังมีข้อจำกัด (แนะนำ JaiTTS แทน)
- เครื่องไม่มี GPU — CPU รันได้แต่ช้ามาก
วิธีเริ่มต้นใช้งาน
# 1. ติดตั้ง
pip install git+https://github.com/biodatlab/thonburian-tts.git
# 2. ติดตั้ง ffmpeg (Linux)
sudo apt install ffmpeg
# 3. รันตัวอย่าง
python f5tts_thai_example.py
หรือลองผ่าน Gradio Demo บน HuggingFace Spaces โดยไม่ต้องติดตั้ง [1]
สรุป
ThonburianTTS เป็น TTS ภาษาไทยที่รันในเครื่องได้ ฟรี และให้เสียงที่เป็นธรรมชาติ — พัฒนาโดยทีมวิจัยไทยจาก Mahidol University
จุดเด่นคือ voice cloning แบบ zero-shot, เสียงภาษาไทยที่ natural, และรัน local ได้โดยไม่ต้องพึ่ง API
ข้อจำกัดคือยังไม่เหมาะกับข้อความยาว, license ห้ามใช้เชิงพาณิชย์, และต้องการ GPU สำหรับความเร็วที่ดี
ถ้าคุณกำลังมองหา TTS ภาษาไทยที่รันในเครื่องได้และฟรี — ThonburianTTS คือตัวเลือกที่ควรลอง
แหล่งอ้างอิง
[1] biodatlab. "ThonburianTTS — Thai Text-to-Speech based on F5-TTS". GitHub. 2025. https://github.com/biodatlab/thonburian-tts
[2] biodatlab. "ThonburianTTS". HuggingFace. 2025. https://huggingface.co/biodatlab/ThonburianTTS
[3] Karnjanaekarin et al. "JaiTTS: A Thai Voice Cloning Model". arXiv. 2026. https://arxiv.org/html/2604.27607
[4] Aung et al. "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech". iSAI-NLP 2025. doi: 10.1109/iSAI-NLP66160.2025.11320472. https://doi.org/10.1109/iSAI-NLP66160.2025.11320472
[5] Spheron Blog. "Self-Host AI Voice Cloning on GPU Cloud: XTTS-2, F5-TTS, and OpenVoice V2". 2026. https://www.spheron.network/blog/self-host-voice-cloning-gpu-cloud-xtts-f5-tts-openvoice-v2/
คุณเคยลองใช้ ThonburianTTS หรือ TTS ภาษาไทยตัวอื่นไหม? คิดว่า voice cloning ภาษาไทยตอนนี้ถึงจุดที่ใช้จริงได้หรือยัง? แชร์มุมมองใต้บทความได้เลยครับ — Nokka ยินดีแลกเปลี่ยน
Top comments (0)