Paxa TTS Flash โมเดล TTS เสียงไทย 32 เสียง กับเบื้องหลังที่ตรวจสอบได้
โดย Nokka (นก-กา) | 19 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka ข้อความในเครื่องหมายคำพูดที่เป็นคำแปลเป็นคำแปลของผม ไม่ใช่สำเนาต้นฉบับ
มีทีมไทยทีมหนึ่งในกรุงเทพฯ ที่สร้างโมเดลเสียงพูดภาษาไทยของตัวเอง แล้วเปิดให้ใช้ผ่าน API พร้อมเปิด weights ของโมเดลวิจัยอีกตัวให้ดาวน์โหลดฟรี [1]
ชื่อทีมคือ Paxa Labs และโมเดลที่กำลังพูดถึงกันคือ Paxa TTS Flash ซึ่งเป็นโมเดลเสียงที่พูดได้สามภาษา และสลับภาษาได้กลางประโยค [1][2]
ผมไปอ่านเอกสารของเขาและ paper วิชาการที่ทีมตีพิมพ์คู่กันมา แล้วเจอเรื่องที่ผมคิดว่าน่าสนใจกว่าราคาและจำนวนเสียง
ภาพรวมบทความ: สองโมเดลเสียงไทยจากทีมเดียวกัน ตัวหนึ่งเป็นบริการสำหรับใช้งานจริง อีกตัวเป็นงานวิจัยที่รันบน CPU ได้
ทีมนี้คือใคร
ห้องวิจัยในกรุงเทพที่เลือกโจทย์ที่คนอื่นมองข้าม
Paxa Labs นิยามตัวเองว่าเป็นห้องวิจัย AI ในกรุงเทพฯ ที่สร้างโมเดลเสียง การแปล และเอกสาร สำหรับภาษาไทยและอังกฤษ แล้วส่งออกเป็น API เดียว [1]
มีชื่อที่คนในวงการ AI ไทยจะจำได้อยู่ในรายชื่อผู้เขียน paper ของทีม นั่นคือ Kunat Pipatanakul ซึ่งเป็นหนึ่งในผู้สร้าง Typhoon และเป็นสมาชิกผู้ก่อตั้งทีม Typhoon ที่ SCB 10X [5][6]
ทีมยังทำงานร่วมกับ Wayu Research ซึ่งเป็นห้องวิจัยไม่แสวงกำไรในกรุงเทพฯ ที่ก่อตั้งโดยผู้สร้าง Typhoon เช่นกัน [7][8]
ผมคิดว่าเหตุผลที่ทีมตั้งใจเลือกโจทย์ภาษาไทยนั้นตรงไปตรงมา และเขียนไว้ดีในประกาศของเขา คือภาษาไทยพังสมมติฐานที่เครื่องมือภาษาโดยทั่วไปสร้างขึ้นมา
- คำไทยเขียนติดกันไม่มีเว้นวรรค จึงต้องมีอะไรสักอย่างตัดสินว่าคำไหนจบตรงไหน
- วรรณยุกต์เปลี่ยนความหมายของคำ
- คนไทยสลับไทยกับอังกฤษกลางประโยค โดยมีชื่อสินค้าและตัวเลขอยู่ในลมหายใจเดียวกัน
- เอกสารธุรกิจวางข้อความไทยอังกฤษ ตาราง ตราประทับ และลายมือ ไว้บนหน้าเดียวกัน
โมเดลทั่วไปมองสิ่งเหล่านี้เป็นกรณียกเว้น แต่สำหรับคนที่สร้างให้ผู้ใช้ไทย มันคือข้อมูลขาเข้า [1]
สองโมเดลที่คนมักสับสนว่าเป็นตัวเดียวกัน
ตารางแยกให้เห็นชัด
ตรงนี้เป็นจุดที่ผมอยากแยกให้ชัดก่อน เพราะหน้าโมเดลบน Hugging Face เขียนเตือนไว้เองว่า อย่าสับสนกับ Paxa TTS Flash [3]
| หัวข้อ | Paxa TTS Flash | Wayu-Paxa-TTS-Edge |
|---|---|---|
| ลักษณะ | บริการพร้อมใช้งาน | ชิ้นงานวิจัยเพื่อทำซ้ำ |
| จำนวนเสียง | 32 เสียง | 12 เสียง |
| ขนาดโมเดล | ไม่เปิดเผย | 82M พารามิเตอร์ |
| ที่รัน | ผ่าน API | รันบนเครื่องเองได้ รวมถึง CPU |
| สัญญาอนุญาต | เชิงพาณิชย์ | CC BY-NC 4.0 |
| การดูแล | มีทีมดูแล | ไม่มีสัญญาการดูแลหรือรับประกัน |
ตัวเลขทั้งหมดผมดึงจากหน้าผลิตภัณฑ์และหน้าโมเดลของทีมเอง [1][3]
หน้าโมเดลเขียนไว้ตรง ๆ ว่า Wayu-Paxa-TTS-Edge เป็น ชิ้นงานวิจัย เปิดเพื่อการทำซ้ำและงานวิจัยต่อจาก paper ไม่ใช่ผลิตภัณฑ์ ไม่มีข้อผูกพันเรื่องการดูแลหรือความพร้อมใช้งาน และไม่มีการรับประกัน [3]
และบอกด้วยว่า ถ้าคุณกำลังส่งมอบให้ผู้ใช้จริง ตัวที่คุณต้องการคือ Paxa TTS Flash [3]
ตัวเลข 32 กับ 26 ที่ยังไม่ตรงกัน
ตัวเลขขัดกันจากช่องทางของทีมเอง
จุดนี้ผมติดใจและอยากชี้ให้เห็น เพราะเป็นรายละเอียดที่คนเขียนข่าวมักข้าม
- หน้า Voices ของเว็บไซต์และเมนูบนทุกหน้า ระบุ 32 เสียง และเขียนว่า "All 32 voices of Paxa TTS Flash on one page" [2]
- แต่ประกาศเปิดตัวบน dev.to ระบุ 26 เสียง โดยเขียนว่า "26 voices, including Isan, Northern, and Southern regional accents and English-first voices" [1]
- โพสต์ TikTok ที่ผมเห็นเป็นจุดตั้งต้นของการค้นครั้งนี้ พูดว่า 32 เสียง [4]
ทั้งสองตัวเลขมาจากช่องทางของทีมเอง ผมจึงยังไม่ยืนยันได้ว่าอันไหนคือจำนวนจริงในปัจจุบัน หรือว่ามีการเพิ่มเสียงระหว่างที่ประกาศกับหน้าเว็บไม่ตรงกัน
ส่วนที่ผมยืนยันได้ คือหน้าเว็บที่ขายบริการอยู่ตอนนี้แสดง 32 และผมเปิดดูรายชื่อเสียงจริงบนหน้านั้นได้ [2]
เสียงที่ตั้งชื่อตามของหวานและของกินไทย
รายชื่อเสียงของทีมนี้เป็นรายละเอียดที่ผมชอบที่สุด และความน่ารักของชื่อก็เป็นแค่ส่วนหนึ่ง
khanomkrok ขนมครก ชาย · เสียงหลัก · ผู้ใหญ่ สุขุม
nomyen นมเย็น หญิง · เสียงหลัก · สดใส คล่องตัว
tako ตะโก้ หญิง · นักเล่าเรื่อง
foithong ฝอยทอง หญิง · ผู้บรรยาย
massaman มัสมั่น ชาย · เสียงพระเอก
thongek ทองเอก ชาย · ผู้ประกาศข่าว
panang พะแนง ชาย · แนวละครเวที
oliang โอเลี้ยง ชาย · วิทยุกลางคืน
sanaechan เสน่ห์จันทน์ หญิง · แสงยามค่ำ
tubtimkrob ทับทิมกรอบ หญิง · อ่านแบบใกล้ชิด
mooping หมูปิ้ง ชาย · พลังข้างถนน
bualoi บัวลอย หญิง · เสียงวัยรุ่น
lukchup ลูกชุบ หญิง · เสียงตัวละคร
lodchong ลอดช่อง หญิง · แนวสงบ
รหัสที่เห็นในคอลัมน์แรกคือค่าที่ส่งในฟิลด์ voice ของ API ผมดึงรายชื่อนี้จากหน้า Voices ของทีมเอง [2]
หน้า Voices ระบุว่ามี เสียงสำเนียงถิ่นอีสาน เหนือ และใต้ รวมอยู่ด้วย และมี เสียงที่ออกแบบมาสำหรับอังกฤษเป็นหลัก [1][2]
ผมคิดว่ารายชื่อนี้บอกอะไรบางอย่าง คือทีมเลือกชื่อที่คนไทยอ่านแล้วเข้าใจทันทีว่าคาแรกเตอร์เป็นแบบไหน ซึ่งเป็นวิธีออกแบบที่ต่างจากโมเดลต่างประเทศที่มักใช้รหัสแบบ th-TH-Standard-A
ส่วนเบื้องหลังที่ผมคิดว่ามีค่าที่สุด
ทางที่สามที่ paper เสนอ
นี่คือส่วนที่ทำให้ผมอยากเขียนบทความนี้ และผมคิดว่าสำคัญกว่าตัวผลิตภัณฑ์
ทีมตีพิมพ์ paper วิชาการเมื่อวันที่ 3 กันยายน 2026 บน arXiv เลขที่ 2609.03502 ชื่อ Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech โดย Kunat Pipatanakul และผู้เขียนร่วมอีก 5 คน [9]
paper เริ่มจากปัญหาที่ผมคิดว่าเฉียบ นั่นคือในภาษาที่มีข้อมูลน้อย การจะใช้ TTS ต้องเลือกอย่างใดอย่างหนึ่ง [9]
- ใช้โมเดลโคลนเสียงขนาดใหญ่ แต่การประมวลผลแพง
- หรือใช้ระบบเสียงประจำตัวที่เล็ก แต่ต้องมีคลังเสียงของคนที่พูดจริง
ทีมเสนอทางที่สาม คือ ใช้โมเดลโคลนเสียงขนาดใหญ่เป็นแหล่งข้อมูลที่สั่งงานได้ แล้วเปลี่ยนเสียงอ้างอิงสั้น ๆ ราว 15 วินาที ให้กลายเป็นโมเดลนักเรียนเสียงประจำตัวที่เล็กกว่า ซึ่งเทรนบนเสียงสังเคราะห์ทั้งหมด [9]
ประโยคที่ทีมเขียนไว้มีน้ำหนักมาก และผมคิดว่าควรยกมาตรง ๆ
"การตั้งค่าแบบนี้ทำให้การออกแบบไปป์ไลน์มีผลตามมา ความผิดพลาดของโมเดลครูกลายเป็นเป้าของการฝึก ในขณะที่การกรองรุ่นที่ล้มเหลวออก อาจลดความครอบคลุมของข้อความที่ยาก" [9]
ผมอ่านประโยคนี้แล้วคิดว่านี่คือคำเตือนที่ตรงไปตรงมาและหาได้ยากในงานวิชาการทั่วไป เพราะมันบอกข้อเสียของวิธีตัวเองไว้ตั้งแต่ย่อหน้าแรก
ตัวเลขที่วัดได้ และคำเตือนของทีมเอง
ตารางผลลัพธ์ที่ตรวจได้ทุกตัว
ผลลัพธ์ที่ทีมรายงานนั้นตรวจได้ทุกตัว และมีคำเตือนกำกับที่ผมคิดว่าสำคัญ [9]
โมเดล Wayu-Paxa-TTS-Edge 82M พารามิเตอร์ · 12 เสียง · 24 kHz
ความแม่นคำในชุดทดสอบยาก 68.2% (เทียบเท่า 85.5% ของ Gemini 3.1)
ความแม่นตำแหน่งหยุด 91.4% (ดีกว่าโมเดลครู OmniVoice 89.9%)
(เทียบเท่า 94.8% ของ Gemini 3.1)
CER ภาษาไทย 3.7%
CER ภาษาอังกฤษ 1.1%
คำเตือนที่ทีมเขียนไว้บนหน้าโมเดลมีสองข้อที่ผมคิดว่าสำคัญ [3]
- ชุดทดสอบความแม่นคำมี 1,531 ประโยค แต่ระบบที่สมบูรณ์แบบก็ทำคะแนนได้ไม่ถึง 100% เพราะ ASR ที่ใช้ให้คะแนนอาจเขียนคำพ้องเสียงของคำที่ออกเสียงถูกอยู่แล้ว ⇒ ทีมจึงเขียนว่าให้ เทียบระบบกับระบบ อย่าเทียบกับ 100%
- เสียงทั้ง 12 เป็นเสียงสังเคราะห์ ซึ่งกลั่นจากโมเดลโคลนเสียงแบบ zero-shot และ ไม่มีเส้นทางการโคลนเสียงในระบบนี้ ⇒ เพราะโมเดลครูถูกเทรนจากเสียงจริงในสภาพแวดล้อมทั่วไป ⇒ ทีมระบุว่าเสียงสังเคราะห์เหล่านี้อาจบังเอิญคล้ายบุคคลจริง โดยที่ทีมไม่ได้เก็บข้อมูลเสียงหรือตั้งใจโคลนใคร
ผมคิดว่าคำเตือนข้อหลังนี้คือความซื่อตรงที่ผมไม่เจอบ่อย และควรมีอยู่ในทุกผลิตภัณฑ์เสียง
จุดที่ตัวเลขนี้ไม่ได้บอก
ตัวเลขนี้วัดอะไร และไม่ได้วัดอะไร
ผมอยากแยกให้ชัดว่าตัวเลข 68.2% และ 91.4% วัดจากอะไร และไม่ได้วัดจากอะไร
- 68.2% คือความแม่นของคำยากในประโยค ไม่ใช่ความแม่นของทั้งประโยค ⇒ ทีมออกแบบชุดนี้ให้มีคำยากหนึ่งคำต่อประโยค เช่น ชื่อแบรนด์ ชื่อคน คำประสมหายาก หรือคำที่เขียนแบบแชต
- 91.4% คือความแม่นของตำแหน่งที่ระบบหยุดหายใจ ⇒ ไม่ได้วัดว่าน้ำเสียงฟังเป็นธรรมชาติแค่ไหน
- ทั้ง 68.2% และ 91.4% เป็นงานวิจัยของทีมเอง ⇒ ไม่ใช่การทดสอบโดยองค์กรอิสระ
และในตารางที่หน้าเว็บวิจัยแสดงไว้ ผมเห็นว่ามีการเทียบกับ OmniVoice ซึ่งเป็นโมเดลครูของตัวเอง ผมคิดว่าการที่โมเดลนักเรียนทำได้ดีกว่าครูในด้านตำแหน่งหยุด เป็นผลที่น่าสนใจ แต่ก็ไม่ใช่การเทียบกับ TTS เชิงพาณิชย์รายอื่น [9]
ราคาและสิ่งที่ต้องรู้ก่อนใช้
เครดิตและแผนรายเดือน
ทีมคิดเงินเป็นเครดิต โดย 1,000 เครดิตเท่ากับ 1 ดอลลาร์ และทุกรุ่นใช้ระบบเครดิตเดียวกัน [1]
ข้อความเสียง (TTS) 15 ดอลลาร์ ต่อ 1 ล้านตัวอักษร
การแปล 25 ดอลลาร์ ต่อ 1 ล้านตัวอักษร
OCR 0.0065 ดอลลาร์ ต่อหน้า
บัญชีใหม่ได้ 100 เครดิตฟรี ไม่ต้องใช้บัตร ซึ่งทีมประเมินว่าเท่ากับประมาณ 11 นาทีของเสียงพูด [10]
แผนรายเดือนเริ่มที่ 6 ดอลลาร์ ซึ่งได้ 8,100 เครดิตต่อเดือน ทีมประเมินว่าเท่ากับประมาณ 14 ชั่วโมงของเสียงพูด และมีแผน 21 ดอลลาร์ที่ได้ 25,200 เครดิต [10]
มีรายละเอียดการคิดเงินที่ผมคิดว่าน่าสนใจและทีมเขียนบทความไว้เอง คือ ระบบคิดเงินก่อนประมวลผล แล้วคืนเครดิตถ้าการประมวลผลล้มเหลว ทีมให้เหตุผลว่าเป็นลำดับที่ถูกต้อง เพราะการเรียกที่ล้มเหลวไม่ควรมีค่าใช้จ่าย [1]
และทีมมี API แบบเข้ากันได้กับ OpenAI ที่ /v1/audio/speech โค้ดเดิมที่เคยเรียก OpenAI ใช้ได้เลยถ้าเปลี่ยน base URL [1]
มุมที่ผมคิดว่าน่าสนใจที่สุดของเรื่องนี้
สามข้อที่ทำให้เรื่องนี้ต่างจากข่าวเปิดตัว API
ทั้งหมดที่เล่ามามีรายละเอียดทางเทคนิคอยู่ไม่กี่บรรทัด ผมจึงอยากปิดด้วยสิ่งที่ทำให้เรื่องนี้ต่างจากข่าวเปิดตัว API ทั่วไป
หนึ่ง · ทีมเปิดทั้งงานวิจัยและ weights โมเดล 82M ที่รันบน CPU ได้ไม่ใช่ตัวเดียวกับที่ขาย แต่การที่ทีมเปิดมันพร้อมชุดทดสอบและกรอบการประเมินให้คนอื่นใช้ต่อ ผมคิดว่าเปลี่ยนบทสนทนาจากการโฆษณาเป็นการตรวจสอบได้ [3][7]
สอง · ชุดทดสอบที่ทีมสร้างคือของขวัญที่แท้จริง thai-tts-keyword-bench มี 1,531 ประโยค และ thai-tts-pause-bench มี 210 ประโยค ทั้งคู่เปิดให้ใช้ ประโยคเหล่านี้คือสิ่งที่ทีมบอกว่าโมเดลเสียงไทยมักทำผิด [7]
สาม · ปัญหาที่ทีมเลือกแก้เป็นปัญหาที่คนไทยเจอจริง การตัดคำในภาษาที่ไม่เว้นวรรค วรรณยุกต์ ชื่อเฉพาะ และการสลับไทยอังกฤษ ทั้งหมดนี้อยู่ในรายการข้อจำกัดที่ทีมระบุเองตั้งแต่ประกาศเปิดตัว [1]
ส่วนคำถามที่ผมยังไม่มีคำตอบ คือในเมื่อทีมเปิดชุดทดสอบและกรอบการประเมินให้ทุกคนใช้ อีกไม่นานเราจะเห็นตัวเลขแบบเดียวกันจากโมเดลเสียงไทยเจ้าอื่นไหม หรือชุดทดสอบนี้จะกลายเป็นมาตรฐานที่เจ้าอื่นเลือกไม่วัดด้วย เพราะไม่ใช่การทดสอบที่ตัวเองทำ
ถ้าคุณอยากลองก่อนตัดสินใจ หน้า paxalabs.com/tts ให้พิมพ์ข้อความและเล่นเสียงได้ทันทีโดยไม่ต้องมีบัญชี และเสียงที่ได้มาจากโมเดลตัวเดียวกับที่ API ใช้ [2]
ถ้าคุณเป็นนักพัฒนา ผมแนะนำให้เริ่มจาก API แบบเข้ากันได้กับ OpenAI เพราะโค้ดเดิมใช้ได้เลย ซึ่งเร็วกว่าการเขียน client ใหม่ [1]
และถ้าคุณสนใจงานวิจัย paper วันที่ 3 กันยายน อ่านได้ฟรีทั้งฉบับ รวมถึงตารางเปรียบเทียบระบบทั้งสาม พร้อมคำอธิบายว่าที่ไหนครูยังทำได้ดีกว่านักเรียน [9]
แหล่งอ้างอิง
[1] DEV Community — "Introducing Paxa Labs" (Paxa Labs) — จำนวนเสียง 26 · ราคา TTS 15 ดอลลาร์/1M ตัวอักษร · แผนรายเดือน · OpenAI-compatible endpoint · ประโยค "26 voices, including Isan, Northern, and Southern regional accents", 28 สิงหาคม 2026 — https://dev.to/paxalabs/introducing-paxa-labs-neo
[2] Paxa Labs — หน้า Voices ("All 32 voices of Paxa TTS Flash" · รายชื่อเสียงและรหัส API · เสียงสำเนียงอีสาน เหนือ ใต้), กันยายน 2026 — https://paxalabs.com/voices
[3] Hugging Face — wayu-ai/wayu-paxa-tts-edge (82M พารามิเตอร์ · 12 เสียง · 24 kHz · CC BY-NC 4.0 · คำเตือน "Not to be confused with Paxa TTS Flash" และคำเตือนเรื่องคะแนน 100% กับเสียงสังเคราะห์), สิงหาคม 2026 — https://huggingface.co/wayu-ai/wayu-paxa-tts-edge
[4] TikTok — @peesamac โพสต์แนะนำ Paxa TTS Flash (ระบุ 32 เสียง · สำเนียงอีสาน เหนือ ใต้ · ต่อ MCP เข้า Claude Code ได้ · 100 เครดิตฟรี), กันยายน 2026 — https://www.tiktok.com/@peesamac/video/7687122241884048658
[5] arXiv — "Typhoon T1: An Open Thai Reasoning Model" (Pittawat Taveekitworachai, Potsawee Manakul, Kasima Tharnpipitchai, Kunat Pipatanakul · SCB 10X R&D), 2025 — https://arxiv.org/html/2502.09042v2
[6] kunatp.com — หน้าผลงานของ Kunat Pipatanakul (Principal Research Scientist, Typhoon Team · สมาชิกผู้ก่อตั้งทีม Typhoon), 2026 — https://www.kunatp.com/work
[7] Paxa Labs — หน้า Research (รายชื่อ paper ทั้งสองฉบับ · รายการโมเดลและชุดทดสอบที่เปิดให้ใช้ · "Three of the twelve teacher voices. None was recorded."), กันยายน 2026 — https://paxalabs.com/research
[8] Wayu Research — หน้าแรก (ห้องวิจัยไม่แสวงกำไรในกรุงเทพฯ ก่อตั้งโดยผู้สร้าง Typhoon), 2026 — https://wayuresearch.com
[9] arXiv — "Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech" (Kunat Pipatanakul และอีก 5 คน · Wayu Research · Paxa Labs · Typhoon), arXiv:2609.03502 [cs.CL] · 18 หน้า · ส่งเมื่อ 3 กันยายน 2026 — https://arxiv.org/abs/2609.03502
[10] Paxa Labs — หน้า Pricing (100 credits ≈ 11 minutes of text to speech · 8,100 credits/เดือน ≈ 14 hours · 25,200 credits ≈ 46 hours · 1,000 credits = 1 ดอลลาร์ · 100 เครดิตฟรีไม่ต้องใช้บัตร · ระบบคิดเงินก่อนประมวลผลและคืนเมื่อล้มเหลว), กันยายน 2026 — https://paxalabs.com/pricing

Top comments (0)