DEV Community

Nokka
Nokka

Posted on

TTS ไทย 3 ตัวเทียบกัน, ThonburianTTS vs OmniVoice vs ElevenLabs ตัวไหนเสียงเหมือนคนที่สุด

TTS ไทย 3 ตัวเทียบกัน, ThonburianTTS vs OmniVoice vs ElevenLabs ตัวไหนเสียงเหมือนคนที่สุด

โดย Nokka (นก-กา) | 11 กันยายน 2026

บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka

คำถามที่คนทำคอนเทนต์เสียงไทยถามกันบ่อยคือ "มี TTS ตัวไหนที่เสียงเหมือนคนจริง" ซึ่งคำตอบเปลี่ยนไปมากในปีนี้ เพราะมีทั้งโมเดลที่ทีมไทยทำเองและโมเดลต่างชาติที่รองรับภาษาไทยได้ดีขึ้น

บทความนี้เทียบสามตัวที่คนพูดถึงมากที่สุด โดยดูว่าตัวไหนเหมาะกับงานแบบไหน

ThonburianTTS: โมเดลที่ทีมไทยทำเพื่อภาษาไทยโดยเฉพาะ

ตัวนี้พัฒนาโดยทีมวิจัยไทย สร้างต่อบนสถาปัตยกรรม F5-TTS ที่ใช้เทคนิค flow matching ในการสร้างเสียง [1]

จุดที่ออกแบบมาเพื่อภาษาไทยโดยตรงคือความแม่นยำในการออกเสียงและความทนทานต่อข้อความที่จัดเรียงไม่เรียบร้อย ซึ่งเป็นปัญหาจริงของภาษาไทยที่มีการเว้นวรรคไม่เป็นระบบ [1]

ความสามารถที่คนสนใจมากคือการโคลนเสียงจากคลิปสั้น และมีทั้งรุ่นที่ทำงานบนตัวอักษรไทยตรง ๆ และรุ่นที่ทำงานบนสัทอักษรสากล [1]

ตัวนี้เผยแพร่งานวิจัยในงานประชุมวิชาการ iSAI-NLP 2025 ที่จัดที่ภูเก็ตด้วย ถือเป็นงานที่ผ่านการตรวจทานทางวิชาการ ไม่ใช่แค่โปรเจกต์โพสต์โซเชียล [1]

OmniVoice: ครอบคลุมภาษามากที่สุด

OmniVoice มาจากทีม k2-fsa รองรับกว่า 600 ภาษา ซึ่งกว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot [2]

ความหมายของ zero-shot คือโคลนเสียงจากคลิปสั้นได้โดยไม่ต้องฝึกโมเดลใหม่ ซึ่งเป็นความสามารถที่เมื่อก่อนต้องจ่ายเงินซื้อบริการเท่านั้น [2]

จุดที่คนไทยสนใจคือมีคลิปทดสอบเสียงไทยออกมาแล้ว และผลตอบรับในวงการคือเสียงชัดกว่าโมเดลทั่วไปที่รองรับไทย

ข้อดีของโมเดลนี้ในมุมของคนทำงานคือ ถ้าต้องทำคอนเทนต์หลายภาษาในโปรเจกต์เดียว ใช้โมเดลเดียวจบ ไม่ต้องสลับเครื่องมือ

ElevenLabs: ตัวที่คนรู้จักมากที่สุด

ElevenLabs เป็นบริการเชิงพาณิชย์ที่คุณภาพเสียงสูงและใช้งานง่ายที่สุด แต่จุดที่ต้องพูดตรง ๆ คือไม่มีเสียงไทยแบบ native

ความหมายคือเสียงไทยที่ได้จะมาจากโมเดลที่ฝึกกับภาษาหลักแล้วพยายามออกเสียงไทยตาม ซึ่งฟังดูใช้ได้ในประโยคสั้น แต่จะเริ่มเพี้ยนเมื่อเจอคำยาวหรือคำที่ออกเสียงยาก

ข้อดีที่ยังเหนือกว่าคือระบบจัดการที่สมบูรณ์ ทั้งการจัดการโปรเจกต์ การแบ่งบท และการปรับแต่งที่ละเอียด ซึ่งโมเดลโอเพนซอร์สยังไม่มี

เทียบให้เห็นภาพ

หัวข้อ ThonburianTTS OmniVoice ElevenLabs
เจ้าของ ทีมวิจัยไทย k2-fsa บริษัทเชิงพาณิชย์
รองรับภาษา ไทยเป็นหลัก 600+ ภาษา หลายภาษา (ไทยไม่ใช่ native)
โคลนเสียง ได้ (คลิปสั้น) ได้ (คลิป 3 วินาที) ได้
ค่าใช้จ่าย ฟรี ฟรี จ่ายตามปริมาณ
รันบนเครื่องเอง ได้ ได้ ไม่ได้
ผ่านงานวิชาการ ใช่ (iSAI-NLP 2025) ไม่ระบุ ไม่เกี่ยวข้อง
เหมาะกับ งานเสียงไทยโดยเฉพาะ งานหลายภาษาพร้อมกัน งานที่ต้องการความสะดวกสูงสุด

ข้อควรระวังก่อนเลือกใช้

หนึ่ง คุณภาพเสียงที่ได้ขึ้นกับคุณภาพคลิปต้นแบบมาก ถ้าคลิปมีเสียงรบกวนหรือบันทึกจากไมโครโฟนไม่ดี เสียงที่โคลนออกมาก็จะพา noise มาด้วย

สอง การโคลนเสียงของบุคคลอื่นมีประเด็นทางกฎหมายและจริยธรรมที่ต้องคิดให้ดี การใช้เสียงตัวเองย่อมไม่มีปัญหา แต่การใช้เสียงคนอื่นต้องมี consent ชัดเจน และในบางประเทศมีกฎหมายเฉพาะเรื่องนี้

สาม โมเดลโอเพนซอร์สต้องติดตั้งและตั้งค่าเอง ซึ่งต้องมีความเข้าใจพื้นฐานเรื่องการรันโมเดล ถ้าไม่อยากยุ่งกับเทอร์มินัลเลย บริการเชิงพาณิชย์ยังเป็นทางที่เร็วที่สุด

สี่ ตัวเลข "600+ ภาษา" เป็นการนับความครอบคลุมของภาษา แต่ไม่ได้บอกคุณภาพในแต่ละภาษา ภาษาที่มีข้อมูลฝึกน้อยกว่าย่อมได้ผลลัพธ์ที่ต่างกัน

มุมมองจากคนที่ทำพอดแคสต์เสียงไทย

ผมแปลงบทความเป็นเสียงอ่านภาษาไทยอยู่บ่อย และเจอปัญหาที่คนพูดถึงน้อยคือเรื่องจังหวะการหายใจ ภาษาไทยมีการเว้นวรรคที่ไม่ตรงกับไวยากรณ์ โมเดลที่ฝึกกับภาษาต่างชาติจึงมักอ่านผิดจังหวะ

จุดที่ผมให้ค่ากับ ThonburianTTS คือการแก้ปัญหานี้ที่ต้นทาง เพราะทีมที่ทำเข้าใจว่าภาษาไทยมีลักษณะอย่างไร ไม่ใช่ปรับโมเดลต่างชาติมาใช้

แต่ความจริงอีกด้านคือเรื่องความสะดวก ThonburianTTS และ OmniVoice ต้องตั้งค่าเอง ซึ่งกินเวลาหลายชั่วโมงในครั้งแรก ถ้าต้องส่งงานพรุ่งนี้เช้า การจ่ายเงินซื้อบริการที่พร้อมใช้ทันทีคือคำตอบที่ตรงกว่า

คำแนะนำที่ผมให้ได้คือถ้างานเสียงไทยเป็นงานประจำ ลงทุนเวลาเรียนรู้ ThonburianTTS คุ้มกว่าในระยะยาว แต่ถ้าเป็นงานครั้งคราว ใช้บริการที่มีอยู่แล้วจะประหยัดเวลากว่า

แหล่งอ้างอิง

[1] Aung, T. และคณะ, "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech", iSAI-NLP 2025, https://github.com/biodatlab/thonburian-tts

[2] k2-fsa, "OmniVoice: High-Quality Voice Cloning TTS for 600+ Languages" (2026), https://github.com/k2-fsa/OmniVoice

Top comments (0)