DEV Community

Nokka
Nokka

Posted on AI-assisted

JaiTTS โคลนเสียงไทยที่คะแนนแม่นกว่ามนุษย์ และเปิดใช้ฟรี

JaiTTS โคลนเสียงไทยที่คะแนนแม่นกว่ามนุษย์ และเปิดใช้ฟรี

โดย Nokka (นก-กา) | 15 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

มีตัวเลขหนึ่งที่ผมอ่านแล้วต้องหยุดดูซ้ำ

JaiTTS-v1.0 ทำคะแนน CER 1.94% ในการโคลนเสียงไทยช่วงสั้น ขณะที่ ค่าอ้างอิงจากมนุษย์อยู่ที่ 1.98% [1]

แปลว่าโมเดลอ่านข้อความไทยได้แม่นกว่าคนจริงในชุดทดสอบนั้น

ทีม JTS (Jasmine Technology Solution) เผยแพร่ผลนี้ใน arXiv เมื่อ 30 เมษายน 2026 พร้อมโค้ดและเดโมให้ลอง [1][2]

CER คืออะไร และทำไม 0.04% ถึงสำคัญ

CER (Character Error Rate) คือสัดส่วนตัวอักษรที่ถอดออกมาผิด เทียบกับข้อความจริง ยิ่งต่ำยิ่งดี [1]

ความต่าง 0.04% ฟังดูน้อย แต่ในบริบทนี้มันหมายถึงอย่างอื่น คือขีดจำกัดล่างไม่ใช่ "ความแม่นของโมเดล" แต่อยู่ที่ ความไม่คงที่ของภาษามนุษย์เอง แม้แต่คนไทยที่ฟังเทปเดียวกัน ก็ถอดตัวอักษรไม่ตรงกันทุกตัว [1]

และ JaiTTS ผ่านเส้นนั้นไปในงานช่วงสั้น [1]

สถาปัตยกรรม: ต่อยอดจาก VoxCPM

ทีมดัดแปลงสถาปัตยกรรมจาก VoxCPM ซึ่งเป็นโมเดล TTS แบบ autoregressive ที่ไม่ใช้ tokenizer [1]

และฝึกต่อ (continual training) บนคลังเสียงที่เน้นภาษาไทยขนาดใหญ่ [1]

จุดที่ผมคิดว่าสำคัญที่สุดในเชิงใช้งานจริง โมเดลประมวลผล ตัวเลขและคำอังกฤษปนไทยได้โดยตรง โดยไม่ต้องทำ text normalization [1]

ทำไมข้อนี้สำคัญ ประโยคไทยจริงในชีวิตประจำวันเต็มไปด้วย "โทร 0812345678" · "จ่าย 1,500 บาท" · "ดู ChatGPT ก่อน" ระบบที่ต้อง normalize ก่อนมักพังตรงจุดนี้ ทีมจึงยกเป็นหนึ่งในสี่ผลงานหลักของเปเปอร์ [1]

ตารางเทียบ

ตารางนี้มี สองคอลัมน์คะแนนที่ไม่เหมือนกัน ผมจึงต้องแยกให้ชัดก่อนเล่า [1]

  • CER = ความผิดพลาดของตัวอักษร (ยิ่งต่ำยิ่งดี)
  • SIM = ความเหมือนของผู้พูด (ยิ่งสูงยิ่งดี)

สองค่านี้คนละทิศกัน ห้ามอ่านรวม

โมเดล CER สั้น SIM สั้น CER ยาว SIM ยาว
มนุษย์ (ค่าอ้างอิง) 1.98 0.61 2.47 0.83
JaiTTS-v1.0 1.94 0.62 2.55 0.76
Qwen3-TTS-0.6B 3.14 0.62 6.10 0.79
Qwen3-TTS-1.7B 2.56 0.62 3.64 0.78
ThonburianTTS 6.26 0.48 ไม่ระบุ ไม่ระบุ
Moss-TTS-v1.5 4.05 0.57 4.39 0.76
Omnivoice 2.73 0.65 6.28 0.82
VoxCPM2 4.98 0.68 3.37 0.80
Kaitom Voice V3 (Alpha) 2.34 0.59 5.81 0.79

อ่านตารางนี้ให้ถูกต้อง และนี่คือส่วนที่คนมักเข้าใจผิด

หนึ่ง: JaiTTS ชนะที่ CER ไม่ใช่ SIM คะแนน SIM ของมันคือ 0.62 (สั้น) และ 0.76 (ยาว) ซึ่ง ไม่ใช่ค่าสูงสุด VoxCPM2 ทำได้ 0.68 ในช่วงสั้น และ Omnivoice ทำได้ 0.82 ในช่วงยาว [1]

สอง: ในงานช่วงยาว JaiTTS แพ้มนุษย์ 2.55 เทียบกับ 2.47 และ SIM ต่ำกว่าชัด (0.76 เทียบ 0.83) [1]

สาม: ThonburianTTS ที่ผมเคยเขียนถึง ได้ CER 6.26 ในชุดทดสอบนี้ ซึ่งเป็นค่าที่แย่กว่าตัวอื่นในตาราง และทีมไม่รายงานผลช่วงยาว [1]

ผมต้องบอกตามตรงว่านี่เป็นชุดทดสอบของทีม JaiTTS เอง ไม่ใช่ benchmark อิสระจากบุคคลที่สาม และ ThonburianTTS เป็นโมเดลที่เผยแพร่ก่อนหน้า การนำมาเทียบจึงต้องอ่านด้วยความระวัง [1]

การประเมินโดยคนไทย 20 คน

เปเปอร์รายงานการทดลองแบบ blind side-by-side ที่ให้คนฟังเลือกโดยไม่รู้ว่าเสียงไหนมาจากไหน [1]

วิธีการ

  • ผู้ประเมิน 20 คน ที่เป็นเจ้าของภาษาไทย
  • ลำโพง 30 เสียง แบ่งเป็นหญิง 15 ชาย 15
  • เสียงตัวอย่างอ้างอิงยาวประมาณ 10-13 วินาที
  • เปรียบเทียบทั้งหมด 400 คู่ กับระบบพาณิชย์

ผลลัพธ์

คู่เปรียบเทียบ JaiTTS ชนะ เสมอ คู่แข่งชนะ
กับ eleven_v3 161 19 20
กับ speech-2.8-hd 122 40 38
รวม 283 59 58

นี่คือตัวเลขที่ผมคิดว่าน้ำหนักกว่าคะแนน CER เพราะมันคือ คนไทยจริงเป็นคนตัดสิน และเป็นการเปรียบเทียบกับระบบพาณิชย์ที่ใช้กันอยู่ ไม่ใช่กับโมเดลทดลอง [1]

และผมต้องย้ำว่า "283 จาก 400" ไม่ได้แปลว่าไม่มีคู่ที่แพ้ ทีมรายงาน 58 คู่ที่แพ้ ไว้ตรง ๆ [1]

ความเร็ว: เร็วกว่าคู่แข่งประมาณ 13 เท่า

โมเดล RTF (ยิ่งต่ำยิ่งดี)
Qwen3-TTS-0.6B 1.5092
Qwen3-TTS-1.7B 1.5409
ThonburianTTS 0.1150
JaiTTS-v1.0 0.1136

RTF = Real-Time Factor ค่า 0.1136 หมายความว่า สร้างเสียง 1 วินาทีใช้เวลาประมวลผลราว 0.11 วินาที คือเร็วกว่าเวลาจริงประมาณ 9 เท่า [1]

และ Qwen3-TTS ที่ค่าเกิน 1.0 หมายถึงใช้เวลานานกว่าเสียงที่ผลิตออกมา ซึ่งในงานจริงต่างกันมาก [1]

ข้อสังเกตที่ผมคิดว่าสำคัญ ThonburianTTS ทำ RTF ได้ 0.1150 ใกล้เคียงกับ JaiTTS มาก ทั้งที่ CER ต่างกันกว่า 3 เท่า คะแนนความแม่นกับความเร็วไม่สัมพันธ์กัน** และ JaiTTS ได้ทั้งสองอย่าง [1]

ใบอนุญาต: จุดที่ต่างจาก ThonburianTTS ชัดเจน

JaiTTS ใช้สัญญาอนุญาต Apache 2.0 [1][3]

ผมต้องเทียบให้ชัดเพราะมันต่างกันที่การนำไปใช้จริง

JaiTTS ThonburianTTS
สัญญาอนุญาต Apache 2.0 โค้ด MIT · โมเดล CC BY-NC-SA 4.0
ใช้เชิงพาณิชย์ ได้ ห้าม

สำหรับคนที่อยากเอาไปทำสินค้า หรือให้บริการลูกค้า ความต่างข้อนี้ตัดสินได้เลย CC BY-NC-SA ห้ามใช้เชิงพาณิชย์ ส่วน Apache 2.0 อนุญาต [1][4]

ลองได้ก่อนตัดสินใจ

ทีมมี เดโมให้ลองฟรี ที่ jaitts-demo.jts.co.th และเผยแพร่บน Hugging Face ที่ JTS-AI [1][2]

ผมแนะนำให้ลองแบบนี้ครับ เตรียมข้อความไทย 3 ประโยคที่ มีตัวเลขและคำอังกฤษปน แล้วลองเทียบกับโมเดลที่คุณใช้อยู่

วิธีนี้จะบอกได้ทันทีว่า จุดขายเรื่อง "ไม่ต้อง normalize" เป็นเรื่องจริงในข้อมูลของคุณหรือไม่ ซึ่งเป็นคำถามที่รีวิวทุกชิ้นตอบให้ไม่ได้ เพราะมันขึ้นกับลักษณะข้อความของคุณเอง [1]

ข้อควรระวัง

หนึ่ง ผมไม่ได้ติดตั้งหรือรันโมเดลนี้ ทั้งหมดเป็นการรายงานจากเปเปอร์และหน้าโมเดลบน Hugging Face [1][2]

สอง ตัวเลขทุกตัวเป็นชุดทดสอบของทีม JaiTTS เอง ไม่ใช่ benchmark อิสระ และมีโมเดลคู่แข่งที่ทีมเลือกมาเปรียบเทียบเอง [1]

สาม repo บน GitHub ระบุชัดว่ามี "benchmark และโค้ดที่ใช้สำหรับ benchmark" ไม่ได้ยืนยันว่ามีโค้ดสำหรับสังเคราะห์เสียงครบชุด [3]

สี่ "แม่นกว่ามนุษย์" เป็นจริงเฉพาะงานช่วงสั้น ในงานช่วงยาว JaiTTS ได้ CER 2.55 เทียบกับค่าอ้างอิงมนุษย์ 2.47 และคะแนน SIM ต่ำกว่าชัดเจน [1]

ห้า วันที่ "30 เมษายน 2026" เป็นวันที่ยื่นเปเปอร์บน arXiv ไม่ใช่วันที่เปิดตัวผลิตภัณฑ์ [1]

หก ผมทำงานบนระบบที่ใช้โมเดล AI และเขียนบทความนี้ด้วยความช่วยเหลือของ AI [5]

ลองก่อนตัดสินใจ

เริ่มจากลองเดโมฟรีดูครับ ถ้าคุณทำงานพากย์เสียงหรือทำสื่อการสอนภาษาไทย ลองส่งข้อความจริงของคุณเข้าไป แล้วฟังว่าเสียงเป็นธรรมชาติพอไหม

บทความที่เกี่ยวข้อง

ซีรีส์นี้มี 3 ตอน ตอนนี้คือตอนที่ 1 เรื่องเสียง ตอนต่อไปจะพูดถึง Thonburian Whisper ซึ่งเป็นอีกด้านของเสียงไทยที่แทบไม่มีคนเขียนถึง และ OpenJAI-v1.0-14B ซึ่งเป็นโมเดลภาษาจากทีมเดียวกันกับ JaiTTS

ถ้าคุณสนใจภาพรวม TTS ไทยทั้งหมด ผมเขียนไว้ที่ เปรียบเทียบ TTS ภาษาไทย โมเดลไหนเหมาะกับงานแบบไหน ด้วย

แหล่งอ้างอิง

[1] Karnjanaekarin, J. et al., "JaiTTS: A Thai Voice Cloning Model", arXiv:2604.27607 (30 เม.ย. 2026), https://arxiv.org/abs/2604.27607

[2] "JaiTTS" โมเดลและเดโมอย่างเป็นทางการ, JTS-AI บน Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/JTS-AI

[3] "JTS-AI-Team/JaiTTS" โค้ดและ benchmark, GitHub (เข้าถึง ก.ย. 2026), https://github.com/JTS-AI-Team/JaiTTS

[4] "ThonburianTTS" โมเดลและสัญญาอนุญาต, Biomedical and Data Lab บน Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab/ThonburianTTS

[5] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้ AI

Top comments (0)