TTS ไทย 3 ตัวเทียบกัน, ThonburianTTS vs OmniVoice vs ElevenLabs ตัวไหนเสียงเหมือนคนที่สุด
โดย Nokka (นก-กา) | 11 กันยายน 2026
บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka
คำถามที่คนทำคอนเทนต์เสียงไทยถามกันบ่อยคือ "มี TTS ตัวไหนที่เสียงเหมือนคนจริง" ซึ่งคำตอบเปลี่ยนไปมากในปีนี้ เพราะมีทั้งโมเดลที่ทีมไทยทำเองและโมเดลต่างชาติที่รองรับภาษาไทยได้ดีขึ้น
บทความนี้เทียบสามตัวที่คนพูดถึงมากที่สุด โดยดูว่าตัวไหนเหมาะกับงานแบบไหน
ThonburianTTS: โมเดลที่ทีมไทยทำเพื่อภาษาไทยโดยเฉพาะ
ตัวนี้พัฒนาโดยทีมวิจัยไทย สร้างต่อบนสถาปัตยกรรม F5-TTS ที่ใช้เทคนิค flow matching ในการสร้างเสียง [1]
จุดที่ออกแบบมาเพื่อภาษาไทยโดยตรงคือความแม่นยำในการออกเสียงและความทนทานต่อข้อความที่จัดเรียงไม่เรียบร้อย ซึ่งเป็นปัญหาจริงของภาษาไทยที่มีการเว้นวรรคไม่เป็นระบบ [1]
ความสามารถที่คนสนใจมากคือการโคลนเสียงจากคลิปสั้น และมีทั้งรุ่นที่ทำงานบนตัวอักษรไทยตรง ๆ และรุ่นที่ทำงานบนสัทอักษรสากล [1]
ตัวนี้เผยแพร่งานวิจัยในงานประชุมวิชาการ iSAI-NLP 2025 ที่จัดที่ภูเก็ตด้วย ถือเป็นงานที่ผ่านการตรวจทานทางวิชาการ ไม่ใช่แค่โปรเจกต์โพสต์โซเชียล [1]
OmniVoice: ครอบคลุมภาษามากที่สุด
OmniVoice มาจากทีม k2-fsa รองรับกว่า 600 ภาษา ซึ่งกว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot [2]
ความหมายของ zero-shot คือโคลนเสียงจากคลิปสั้นได้โดยไม่ต้องฝึกโมเดลใหม่ ซึ่งเป็นความสามารถที่เมื่อก่อนต้องจ่ายเงินซื้อบริการเท่านั้น [2]
จุดที่คนไทยสนใจคือมีคลิปทดสอบเสียงไทยออกมาแล้ว และผลตอบรับในวงการคือเสียงชัดกว่าโมเดลทั่วไปที่รองรับไทย
ข้อดีของโมเดลนี้ในมุมของคนทำงานคือ ถ้าต้องทำคอนเทนต์หลายภาษาในโปรเจกต์เดียว ใช้โมเดลเดียวจบ ไม่ต้องสลับเครื่องมือ
ElevenLabs: ตัวที่คนรู้จักมากที่สุด
ElevenLabs เป็นบริการเชิงพาณิชย์ที่คุณภาพเสียงสูงและใช้งานง่ายที่สุด แต่จุดที่ต้องพูดตรง ๆ คือไม่มีเสียงไทยแบบ native
ความหมายคือเสียงไทยที่ได้จะมาจากโมเดลที่ฝึกกับภาษาหลักแล้วพยายามออกเสียงไทยตาม ซึ่งฟังดูใช้ได้ในประโยคสั้น แต่จะเริ่มเพี้ยนเมื่อเจอคำยาวหรือคำที่ออกเสียงยาก
ข้อดีที่ยังเหนือกว่าคือระบบจัดการที่สมบูรณ์ ทั้งการจัดการโปรเจกต์ การแบ่งบท และการปรับแต่งที่ละเอียด ซึ่งโมเดลโอเพนซอร์สยังไม่มี
เทียบให้เห็นภาพ
| หัวข้อ | ThonburianTTS | OmniVoice | ElevenLabs |
|---|---|---|---|
| เจ้าของ | ทีมวิจัยไทย | k2-fsa | บริษัทเชิงพาณิชย์ |
| รองรับภาษา | ไทยเป็นหลัก | 600+ ภาษา | หลายภาษา (ไทยไม่ใช่ native) |
| โคลนเสียง | ได้ (คลิปสั้น) | ได้ (คลิป 3 วินาที) | ได้ |
| ค่าใช้จ่าย | ฟรี | ฟรี | จ่ายตามปริมาณ |
| รันบนเครื่องเอง | ได้ | ได้ | ไม่ได้ |
| ผ่านงานวิชาการ | ใช่ (iSAI-NLP 2025) | ไม่ระบุ | ไม่เกี่ยวข้อง |
| เหมาะกับ | งานเสียงไทยโดยเฉพาะ | งานหลายภาษาพร้อมกัน | งานที่ต้องการความสะดวกสูงสุด |
ข้อควรระวังก่อนเลือกใช้
หนึ่ง คุณภาพเสียงที่ได้ขึ้นกับคุณภาพคลิปต้นแบบมาก ถ้าคลิปมีเสียงรบกวนหรือบันทึกจากไมโครโฟนไม่ดี เสียงที่โคลนออกมาก็จะพา noise มาด้วย
สอง การโคลนเสียงของบุคคลอื่นมีประเด็นทางกฎหมายและจริยธรรมที่ต้องคิดให้ดี การใช้เสียงตัวเองย่อมไม่มีปัญหา แต่การใช้เสียงคนอื่นต้องมี consent ชัดเจน และในบางประเทศมีกฎหมายเฉพาะเรื่องนี้
สาม โมเดลโอเพนซอร์สต้องติดตั้งและตั้งค่าเอง ซึ่งต้องมีความเข้าใจพื้นฐานเรื่องการรันโมเดล ถ้าไม่อยากยุ่งกับเทอร์มินัลเลย บริการเชิงพาณิชย์ยังเป็นทางที่เร็วที่สุด
สี่ ตัวเลข "600+ ภาษา" เป็นการนับความครอบคลุมของภาษา แต่ไม่ได้บอกคุณภาพในแต่ละภาษา ภาษาที่มีข้อมูลฝึกน้อยกว่าย่อมได้ผลลัพธ์ที่ต่างกัน
มุมมองจากคนที่ทำพอดแคสต์เสียงไทย
ผมแปลงบทความเป็นเสียงอ่านภาษาไทยอยู่บ่อย และเจอปัญหาที่คนพูดถึงน้อยคือเรื่องจังหวะการหายใจ ภาษาไทยมีการเว้นวรรคที่ไม่ตรงกับไวยากรณ์ โมเดลที่ฝึกกับภาษาต่างชาติจึงมักอ่านผิดจังหวะ
จุดที่ผมให้ค่ากับ ThonburianTTS คือการแก้ปัญหานี้ที่ต้นทาง เพราะทีมที่ทำเข้าใจว่าภาษาไทยมีลักษณะอย่างไร ไม่ใช่ปรับโมเดลต่างชาติมาใช้
แต่ความจริงอีกด้านคือเรื่องความสะดวก ThonburianTTS และ OmniVoice ต้องตั้งค่าเอง ซึ่งกินเวลาหลายชั่วโมงในครั้งแรก ถ้าต้องส่งงานพรุ่งนี้เช้า การจ่ายเงินซื้อบริการที่พร้อมใช้ทันทีคือคำตอบที่ตรงกว่า
คำแนะนำที่ผมให้ได้คือถ้างานเสียงไทยเป็นงานประจำ ลงทุนเวลาเรียนรู้ ThonburianTTS คุ้มกว่าในระยะยาว แต่ถ้าเป็นงานครั้งคราว ใช้บริการที่มีอยู่แล้วจะประหยัดเวลากว่า
แหล่งอ้างอิง
[1] Aung, T. และคณะ, "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech", iSAI-NLP 2025, https://github.com/biodatlab/thonburian-tts
[2] k2-fsa, "OmniVoice: High-Quality Voice Cloning TTS for 600+ Languages" (2026), https://github.com/k2-fsa/OmniVoice
Top comments (0)