DEV Community

Nokka
Nokka

Posted on

ThonburianTTS — AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย

ThonburianTTS — AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย

โดย Nokka (นก-กา) | 8 สิงหาคม 2569

บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ — Nokka (นก-กา)

ถ้าคุณกำลังมองหา Text-to-Speech ภาษาไทยที่รันในเครื่องตัวเองได้ ไม่ต้องเสียค่า API และฟังดูเป็นธรรมชาติ — ThonburianTTS คือคำตอบที่น่าสนใจที่สุดในตอนนี้

พัฒนาโดยทีมวิจัยจาก Mahidol University ร่วมกับ Looloo Technology โมเดลนี้ถูกนำเสนอในงานประชุมวิชาการ iSAI-NLP 2025 และเปิดให้ใช้ฟรีบน HuggingFace กับ GitHub [1][2]

บทความนี้จะพาไปดูว่า ThonburianTTS คืออะไร ใช้ทำอะไรได้บ้าง ข้อดีข้อเสีย และเหมาะกับใคร


ThonburianTTS คืออะไร

ThonburianTTS เป็น Text-to-Speech ภาษาไทยที่พัฒนาต่อยอดจาก F5-TTS (Flow Matching) สถาปัตยกรรมที่ใช้เทคนิค diffusion-based flow matching เพื่อสร้างเสียงพูดที่เป็นธรรมชาติ [1]

จุดเด่นที่ทำให้ ThonburianTTS แตกต่างจาก TTS ทั่วไป:

คุณสมบัติ รายละเอียด
ภาษา ภาษาไทยเป็นหลัก (รองรับทั้ง Thai script และ IPA)
Voice Cloning Zero-shot — ใช้เสียงตัวอย่างสั้นๆ (5-10 วินาที) เพื่อเลียนแบบเสียง
การรัน Local — รันบนเครื่องตัวเองได้ทั้ง GPU และ CPU
ขนาดโมเดล ~1.35 GB (ประมาณ 500M parameters)
License โค้ด MIT, โมเดล CC BY-NC-SA 4.0 (ห้ามใช้เชิงพาณิชย์)
ผู้พัฒนา Biomedical and Data Lab, Mahidol University + Looloo Technology

ใช้ทำอะไรได้บ้าง

ThonburianTTS เหมาะกับงานที่ต้องการเสียงพูดภาษาไทยที่เป็นธรรมชาติ โดยไม่ต้องพึ่ง API ภายนอก [1]:

  • ระบบพากย์เสียงภาษาไทย — พากย์วิดีโอ, สื่อการสอน, audiobook
  • AI Voice Bot ภาษาไทย — ทำ chatbot ที่พูดภาษาไทยได้
  • Voice Cloning ส่วนตัว — โคลนเสียงตัวเองหรือเสียงคนในทีม
  • ระบบอ่านข้อความภาษาไทย — อ่านบทความ, ข่าว, เอกสาร
  • งานวิจัยและพัฒนา — ต่อยอด TTS ภาษาไทยในเชิงวิชาการ

จุดเด่นที่ทำให้ ThonburianTTS น่าสนใจ

1. เสียงภาษาไทยที่เป็นธรรมชาติ

ThonburianTTS ถูก fine-tune บนข้อมูลภาษาไทยโดยเฉพาะ (GigaSpeech2) ทำให้ออกเสียงภาษาไทยได้ถูกต้องและเป็นธรรมชาติกว่าโมเดล multilingual ทั่วไป [1][3]

ผู้ใช้หลายคนรายงานว่า ThonburianTTS ให้เสียงภาษาไทยที่ดีกว่า Qwen-TTS และ OmniVoice ซึ่งเป็นโมเดล multilingual ที่ไม่ได้ optimize สำหรับภาษาไทย

2. Voice Cloning แบบ Zero-Shot

ใช้เสียงตัวอย่างสั้นๆ เพียง 5-10 วินาที ก็สามารถเลียนแบบเสียงต้นฉบับได้ โดยงานวิจัยต้นฉบับรายงาน similarity scores ที่ 84-89% [4]

3. รันในเครื่องได้ ไม่ต้องพึ่ง Cloud

ติดตั้งผ่าน pip คำสั่งเดียว:

pip install git+https://github.com/biodatlab/thonburian-tts.git
Enter fullscreen mode Exit fullscreen mode

ใช้ GPU (NVIDIA CUDA) หรือ CPU ก็ได้ — GPU จะเร็วกว่า แต่ CPU ก็รันได้ (ช้ากว่า) [1]

4. ปรับแต่งได้

  • ปรับความเร็วเสียง (speed control)
  • ตัดช่วงเงียบ (silence trimming)
  • รักษาสไตล์เสียงต้นฉบับ (voice style preservation)

5. มี Gradio Demo ให้ลองใช้

ทีมพัฒนาทำ Gradio Web UI ให้ลองใช้ผ่าน HuggingFace Spaces ได้ทันที โดยไม่ต้องติดตั้งอะไร [1]


ข้อจำกัดที่ควรรู้

1. ไม่เหมาะกับข้อความยาว

งานวิจัย JaiTTS (2026) ระบุว่า ThonburianTTS "fails to generate sensible output" สำหรับข้อความยาว เพราะถูกเทรนบน GigaSpeech2 ซึ่งเป็นชุดข้อมูลที่เน้น utterances สั้นๆ [3]

2. Zero-shot cloning ยังมีข้อจำกัด

ถึงแม้ similarity scores จะสูง (84-89%) แต่ JaiTTS paper ระบุว่า ThonburianTTS ยังมีข้อจำกัดด้าน zero-shot speaker cloning เมื่อเทียบกับโมเดลที่ใหม่กว่า [3]

3. License ห้ามใช้เชิงพาณิชย์

  • โค้ด: MIT (ใช้ได้อิสระ)
  • โมเดล: CC BY-NC-SA 4.0 — ห้ามใช้ในเชิงพาณิชย์ ถ้าจะใช้ต้องขออนุญาตจากทีมพัฒนา [1]

4. ต้องการ VRAM ~2-3 GB

F5-TTS ต้องการ VRAM ประมาณ 2-3 GB สำหรับ inference — ถ้าใช้ CPU จะช้ากว่ามาก [5]


เปรียบเทียบกับโมเดลอื่น

โมเดล ภาษา Voice Cloning License ขนาด จุดเด่น
ThonburianTTS ไทย (หลัก) ✅ Zero-shot CC BY-NC-SA 4.0 ~1.35 GB เสียงไทยธรรมชาติ, รัน local
Qwen-TTS หลายภาษา Apache 2.0 0.6B-1.7B หลายภาษา, แข็งแกร่ง
OmniVoice หลายภาษา แตกต่างตามรุ่น แตกต่าง Voice cloning คุณภาพดี
JaiTTS ไทย (หลัก) CC BY 4.0 ใหญ่กว่า ข้อความยาวได้, CER 1.94%

สรุป: ThonburianTTS เหนือกว่าสำหรับงานภาษาไทยที่ต้องการความ natural และรัน local ได้ แต่ถ้าต้องการข้อความยาวหรือใช้เชิงพาณิชย์ ควรพิจารณา JaiTTS หรือ Qwen-TTS แทน


เหมาะกับใคร

เหมาะกับ

  • นักพัฒนาไทย ที่อยากทำระบบ TTS ภาษาไทยโดยไม่เสียค่า API
  • นักวิจัย ที่ต้องการต่อยอด TTS ภาษาไทย
  • ผู้ใช้ทั่วไป ที่อยากลอง voice cloning ภาษาไทย
  • งาน non-commercial — งานวิจัย, โปรเจกต์ส่วนตัว, งานอดิเรก

เหมาะน้อยกว่า

  • งานเชิงพาณิชย์ — ต้องขอ license เพิ่มเติม
  • ข้อความยาว — ยังมีข้อจำกัด (แนะนำ JaiTTS แทน)
  • เครื่องไม่มี GPU — CPU รันได้แต่ช้ามาก

วิธีเริ่มต้นใช้งาน

# 1. ติดตั้ง
pip install git+https://github.com/biodatlab/thonburian-tts.git

# 2. ติดตั้ง ffmpeg (Linux)
sudo apt install ffmpeg

# 3. รันตัวอย่าง
python f5tts_thai_example.py
Enter fullscreen mode Exit fullscreen mode

หรือลองผ่าน Gradio Demo บน HuggingFace Spaces โดยไม่ต้องติดตั้ง [1]


สรุป

ThonburianTTS เป็น TTS ภาษาไทยที่รันในเครื่องได้ ฟรี และให้เสียงที่เป็นธรรมชาติ — พัฒนาโดยทีมวิจัยไทยจาก Mahidol University

จุดเด่นคือ voice cloning แบบ zero-shot, เสียงภาษาไทยที่ natural, และรัน local ได้โดยไม่ต้องพึ่ง API

ข้อจำกัดคือยังไม่เหมาะกับข้อความยาว, license ห้ามใช้เชิงพาณิชย์, และต้องการ GPU สำหรับความเร็วที่ดี

ถ้าคุณกำลังมองหา TTS ภาษาไทยที่รันในเครื่องได้และฟรี — ThonburianTTS คือตัวเลือกที่ควรลอง


แหล่งอ้างอิง

[1] biodatlab. "ThonburianTTS — Thai Text-to-Speech based on F5-TTS". GitHub. 2025. https://github.com/biodatlab/thonburian-tts

[2] biodatlab. "ThonburianTTS". HuggingFace. 2025. https://huggingface.co/biodatlab/ThonburianTTS

[3] Karnjanaekarin et al. "JaiTTS: A Thai Voice Cloning Model". arXiv. 2026. https://arxiv.org/html/2604.27607

[4] Aung et al. "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech". iSAI-NLP 2025. doi: 10.1109/iSAI-NLP66160.2025.11320472. https://doi.org/10.1109/iSAI-NLP66160.2025.11320472

[5] Spheron Blog. "Self-Host AI Voice Cloning on GPU Cloud: XTTS-2, F5-TTS, and OpenVoice V2". 2026. https://www.spheron.network/blog/self-host-voice-cloning-gpu-cloud-xtts-f5-tts-openvoice-v2/


คุณเคยลองใช้ ThonburianTTS หรือ TTS ภาษาไทยตัวอื่นไหม? คิดว่า voice cloning ภาษาไทยตอนนี้ถึงจุดที่ใช้จริงได้หรือยัง? แชร์มุมมองใต้บทความได้เลยครับ — Nokka ยินดีแลกเปลี่ยน

Top comments (0)