JaiTTS โคลนเสียงไทยที่คะแนนแม่นกว่ามนุษย์ และเปิดใช้ฟรี
โดย Nokka (นก-กา) | 15 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
มีตัวเลขหนึ่งที่ผมอ่านแล้วต้องหยุดดูซ้ำ
JaiTTS-v1.0 ทำคะแนน CER 1.94% ในการโคลนเสียงไทยช่วงสั้น ขณะที่ ค่าอ้างอิงจากมนุษย์อยู่ที่ 1.98% [1]
แปลว่าโมเดลอ่านข้อความไทยได้แม่นกว่าคนจริงในชุดทดสอบนั้น
ทีม JTS (Jasmine Technology Solution) เผยแพร่ผลนี้ใน arXiv เมื่อ 30 เมษายน 2026 พร้อมโค้ดและเดโมให้ลอง [1][2]
CER คืออะไร และทำไม 0.04% ถึงสำคัญ
CER (Character Error Rate) คือสัดส่วนตัวอักษรที่ถอดออกมาผิด เทียบกับข้อความจริง ยิ่งต่ำยิ่งดี [1]
ความต่าง 0.04% ฟังดูน้อย แต่ในบริบทนี้มันหมายถึงอย่างอื่น คือขีดจำกัดล่างไม่ใช่ "ความแม่นของโมเดล" แต่อยู่ที่ ความไม่คงที่ของภาษามนุษย์เอง แม้แต่คนไทยที่ฟังเทปเดียวกัน ก็ถอดตัวอักษรไม่ตรงกันทุกตัว [1]
และ JaiTTS ผ่านเส้นนั้นไปในงานช่วงสั้น [1]
สถาปัตยกรรม: ต่อยอดจาก VoxCPM
ทีมดัดแปลงสถาปัตยกรรมจาก VoxCPM ซึ่งเป็นโมเดล TTS แบบ autoregressive ที่ไม่ใช้ tokenizer [1]
และฝึกต่อ (continual training) บนคลังเสียงที่เน้นภาษาไทยขนาดใหญ่ [1]
จุดที่ผมคิดว่าสำคัญที่สุดในเชิงใช้งานจริง โมเดลประมวลผล ตัวเลขและคำอังกฤษปนไทยได้โดยตรง โดยไม่ต้องทำ text normalization [1]
ทำไมข้อนี้สำคัญ ประโยคไทยจริงในชีวิตประจำวันเต็มไปด้วย "โทร 0812345678" · "จ่าย 1,500 บาท" · "ดู ChatGPT ก่อน" ระบบที่ต้อง normalize ก่อนมักพังตรงจุดนี้ ทีมจึงยกเป็นหนึ่งในสี่ผลงานหลักของเปเปอร์ [1]
ตารางเทียบ
ตารางนี้มี สองคอลัมน์คะแนนที่ไม่เหมือนกัน ผมจึงต้องแยกให้ชัดก่อนเล่า [1]
- CER = ความผิดพลาดของตัวอักษร (ยิ่งต่ำยิ่งดี)
- SIM = ความเหมือนของผู้พูด (ยิ่งสูงยิ่งดี)
สองค่านี้คนละทิศกัน ห้ามอ่านรวม
| โมเดล | CER สั้น | SIM สั้น | CER ยาว | SIM ยาว |
|---|---|---|---|---|
| มนุษย์ (ค่าอ้างอิง) | 1.98 | 0.61 | 2.47 | 0.83 |
| JaiTTS-v1.0 | 1.94 | 0.62 | 2.55 | 0.76 |
| Qwen3-TTS-0.6B | 3.14 | 0.62 | 6.10 | 0.79 |
| Qwen3-TTS-1.7B | 2.56 | 0.62 | 3.64 | 0.78 |
| ThonburianTTS | 6.26 | 0.48 | ไม่ระบุ | ไม่ระบุ |
| Moss-TTS-v1.5 | 4.05 | 0.57 | 4.39 | 0.76 |
| Omnivoice | 2.73 | 0.65 | 6.28 | 0.82 |
| VoxCPM2 | 4.98 | 0.68 | 3.37 | 0.80 |
| Kaitom Voice V3 (Alpha) | 2.34 | 0.59 | 5.81 | 0.79 |
อ่านตารางนี้ให้ถูกต้อง และนี่คือส่วนที่คนมักเข้าใจผิด
หนึ่ง: JaiTTS ชนะที่ CER ไม่ใช่ SIM คะแนน SIM ของมันคือ 0.62 (สั้น) และ 0.76 (ยาว) ซึ่ง ไม่ใช่ค่าสูงสุด VoxCPM2 ทำได้ 0.68 ในช่วงสั้น และ Omnivoice ทำได้ 0.82 ในช่วงยาว [1]
สอง: ในงานช่วงยาว JaiTTS แพ้มนุษย์ 2.55 เทียบกับ 2.47 และ SIM ต่ำกว่าชัด (0.76 เทียบ 0.83) [1]
สาม: ThonburianTTS ที่ผมเคยเขียนถึง ได้ CER 6.26 ในชุดทดสอบนี้ ซึ่งเป็นค่าที่แย่กว่าตัวอื่นในตาราง และทีมไม่รายงานผลช่วงยาว [1]
ผมต้องบอกตามตรงว่านี่เป็นชุดทดสอบของทีม JaiTTS เอง ไม่ใช่ benchmark อิสระจากบุคคลที่สาม และ ThonburianTTS เป็นโมเดลที่เผยแพร่ก่อนหน้า การนำมาเทียบจึงต้องอ่านด้วยความระวัง [1]
การประเมินโดยคนไทย 20 คน
เปเปอร์รายงานการทดลองแบบ blind side-by-side ที่ให้คนฟังเลือกโดยไม่รู้ว่าเสียงไหนมาจากไหน [1]
วิธีการ
- ผู้ประเมิน 20 คน ที่เป็นเจ้าของภาษาไทย
- ลำโพง 30 เสียง แบ่งเป็นหญิง 15 ชาย 15
- เสียงตัวอย่างอ้างอิงยาวประมาณ 10-13 วินาที
- เปรียบเทียบทั้งหมด 400 คู่ กับระบบพาณิชย์
ผลลัพธ์
| คู่เปรียบเทียบ | JaiTTS ชนะ | เสมอ | คู่แข่งชนะ |
|---|---|---|---|
| กับ eleven_v3 | 161 | 19 | 20 |
| กับ speech-2.8-hd | 122 | 40 | 38 |
| รวม | 283 | 59 | 58 |
นี่คือตัวเลขที่ผมคิดว่าน้ำหนักกว่าคะแนน CER เพราะมันคือ คนไทยจริงเป็นคนตัดสิน และเป็นการเปรียบเทียบกับระบบพาณิชย์ที่ใช้กันอยู่ ไม่ใช่กับโมเดลทดลอง [1]
และผมต้องย้ำว่า "283 จาก 400" ไม่ได้แปลว่าไม่มีคู่ที่แพ้ ทีมรายงาน 58 คู่ที่แพ้ ไว้ตรง ๆ [1]
ความเร็ว: เร็วกว่าคู่แข่งประมาณ 13 เท่า
| โมเดล | RTF (ยิ่งต่ำยิ่งดี) |
|---|---|
| Qwen3-TTS-0.6B | 1.5092 |
| Qwen3-TTS-1.7B | 1.5409 |
| ThonburianTTS | 0.1150 |
| JaiTTS-v1.0 | 0.1136 |
RTF = Real-Time Factor ค่า 0.1136 หมายความว่า สร้างเสียง 1 วินาทีใช้เวลาประมวลผลราว 0.11 วินาที คือเร็วกว่าเวลาจริงประมาณ 9 เท่า [1]
และ Qwen3-TTS ที่ค่าเกิน 1.0 หมายถึงใช้เวลานานกว่าเสียงที่ผลิตออกมา ซึ่งในงานจริงต่างกันมาก [1]
ข้อสังเกตที่ผมคิดว่าสำคัญ ThonburianTTS ทำ RTF ได้ 0.1150 ใกล้เคียงกับ JaiTTS มาก ทั้งที่ CER ต่างกันกว่า 3 เท่า คะแนนความแม่นกับความเร็วไม่สัมพันธ์กัน** และ JaiTTS ได้ทั้งสองอย่าง [1]
ใบอนุญาต: จุดที่ต่างจาก ThonburianTTS ชัดเจน
JaiTTS ใช้สัญญาอนุญาต Apache 2.0 [1][3]
ผมต้องเทียบให้ชัดเพราะมันต่างกันที่การนำไปใช้จริง
| JaiTTS | ThonburianTTS | |
|---|---|---|
| สัญญาอนุญาต | Apache 2.0 | โค้ด MIT · โมเดล CC BY-NC-SA 4.0 |
| ใช้เชิงพาณิชย์ | ได้ | ห้าม |
สำหรับคนที่อยากเอาไปทำสินค้า หรือให้บริการลูกค้า ความต่างข้อนี้ตัดสินได้เลย CC BY-NC-SA ห้ามใช้เชิงพาณิชย์ ส่วน Apache 2.0 อนุญาต [1][4]
ลองได้ก่อนตัดสินใจ
ทีมมี เดโมให้ลองฟรี ที่ jaitts-demo.jts.co.th และเผยแพร่บน Hugging Face ที่ JTS-AI [1][2]
ผมแนะนำให้ลองแบบนี้ครับ เตรียมข้อความไทย 3 ประโยคที่ มีตัวเลขและคำอังกฤษปน แล้วลองเทียบกับโมเดลที่คุณใช้อยู่
วิธีนี้จะบอกได้ทันทีว่า จุดขายเรื่อง "ไม่ต้อง normalize" เป็นเรื่องจริงในข้อมูลของคุณหรือไม่ ซึ่งเป็นคำถามที่รีวิวทุกชิ้นตอบให้ไม่ได้ เพราะมันขึ้นกับลักษณะข้อความของคุณเอง [1]
ข้อควรระวัง
หนึ่ง ผมไม่ได้ติดตั้งหรือรันโมเดลนี้ ทั้งหมดเป็นการรายงานจากเปเปอร์และหน้าโมเดลบน Hugging Face [1][2]
สอง ตัวเลขทุกตัวเป็นชุดทดสอบของทีม JaiTTS เอง ไม่ใช่ benchmark อิสระ และมีโมเดลคู่แข่งที่ทีมเลือกมาเปรียบเทียบเอง [1]
สาม repo บน GitHub ระบุชัดว่ามี "benchmark และโค้ดที่ใช้สำหรับ benchmark" ไม่ได้ยืนยันว่ามีโค้ดสำหรับสังเคราะห์เสียงครบชุด [3]
สี่ "แม่นกว่ามนุษย์" เป็นจริงเฉพาะงานช่วงสั้น ในงานช่วงยาว JaiTTS ได้ CER 2.55 เทียบกับค่าอ้างอิงมนุษย์ 2.47 และคะแนน SIM ต่ำกว่าชัดเจน [1]
ห้า วันที่ "30 เมษายน 2026" เป็นวันที่ยื่นเปเปอร์บน arXiv ไม่ใช่วันที่เปิดตัวผลิตภัณฑ์ [1]
หก ผมทำงานบนระบบที่ใช้โมเดล AI และเขียนบทความนี้ด้วยความช่วยเหลือของ AI [5]
ลองก่อนตัดสินใจ
เริ่มจากลองเดโมฟรีดูครับ ถ้าคุณทำงานพากย์เสียงหรือทำสื่อการสอนภาษาไทย ลองส่งข้อความจริงของคุณเข้าไป แล้วฟังว่าเสียงเป็นธรรมชาติพอไหม
บทความที่เกี่ยวข้อง
ซีรีส์นี้มี 3 ตอน ตอนนี้คือตอนที่ 1 เรื่องเสียง ตอนต่อไปจะพูดถึง Thonburian Whisper ซึ่งเป็นอีกด้านของเสียงไทยที่แทบไม่มีคนเขียนถึง และ OpenJAI-v1.0-14B ซึ่งเป็นโมเดลภาษาจากทีมเดียวกันกับ JaiTTS
ถ้าคุณสนใจภาพรวม TTS ไทยทั้งหมด ผมเขียนไว้ที่ เปรียบเทียบ TTS ภาษาไทย โมเดลไหนเหมาะกับงานแบบไหน ด้วย
แหล่งอ้างอิง
[1] Karnjanaekarin, J. et al., "JaiTTS: A Thai Voice Cloning Model", arXiv:2604.27607 (30 เม.ย. 2026), https://arxiv.org/abs/2604.27607
[2] "JaiTTS" โมเดลและเดโมอย่างเป็นทางการ, JTS-AI บน Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/JTS-AI
[3] "JTS-AI-Team/JaiTTS" โค้ดและ benchmark, GitHub (เข้าถึง ก.ย. 2026), https://github.com/JTS-AI-Team/JaiTTS
[4] "ThonburianTTS" โมเดลและสัญญาอนุญาต, Biomedical and Data Lab บน Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab/ThonburianTTS
[5] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้ AI
Top comments (0)