DEV Community

Nokka
Nokka

Posted on AI-assisted

Paxa TTS Flash โมเดล TTS เสียงไทย 32 เสียง และเบื้องหลังที่ตรวจสอบได้

Paxa TTS Flash โมเดล TTS เสียงไทย 32 เสียง กับเบื้องหลังที่ตรวจสอบได้

โดย Nokka (นก-กา) | 19 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka ข้อความในเครื่องหมายคำพูดที่เป็นคำแปลเป็นคำแปลของผม ไม่ใช่สำเนาต้นฉบับ

มีทีมไทยทีมหนึ่งในกรุงเทพฯ ที่สร้างโมเดลเสียงพูดภาษาไทยของตัวเอง แล้วเปิดให้ใช้ผ่าน API พร้อมเปิด weights ของโมเดลวิจัยอีกตัวให้ดาวน์โหลดฟรี [1]

ชื่อทีมคือ Paxa Labs และโมเดลที่กำลังพูดถึงกันคือ Paxa TTS Flash ซึ่งเป็นโมเดลเสียงที่พูดได้สามภาษา และสลับภาษาได้กลางประโยค [1][2]

ผมไปอ่านเอกสารของเขาและ paper วิชาการที่ทีมตีพิมพ์คู่กันมา แล้วเจอเรื่องที่ผมคิดว่าน่าสนใจกว่าราคาและจำนวนเสียง

เทียบสองโมเดลเสียงไทยจาก Paxa Labs: Paxa TTS Flash สำหรับใช้งานจริง กับ Wayu-Paxa-TTS-Edge งานวิจัยที่รันบน CPU

ภาพรวมบทความ: สองโมเดลเสียงไทยจากทีมเดียวกัน ตัวหนึ่งเป็นบริการสำหรับใช้งานจริง อีกตัวเป็นงานวิจัยที่รันบน CPU ได้

ทีมนี้คือใคร

ห้องวิจัยในกรุงเทพที่เลือกโจทย์ที่คนอื่นมองข้าม

Paxa Labs นิยามตัวเองว่าเป็นห้องวิจัย AI ในกรุงเทพฯ ที่สร้างโมเดลเสียง การแปล และเอกสาร สำหรับภาษาไทยและอังกฤษ แล้วส่งออกเป็น API เดียว [1]

มีชื่อที่คนในวงการ AI ไทยจะจำได้อยู่ในรายชื่อผู้เขียน paper ของทีม นั่นคือ Kunat Pipatanakul ซึ่งเป็นหนึ่งในผู้สร้าง Typhoon และเป็นสมาชิกผู้ก่อตั้งทีม Typhoon ที่ SCB 10X [5][6]

ทีมยังทำงานร่วมกับ Wayu Research ซึ่งเป็นห้องวิจัยไม่แสวงกำไรในกรุงเทพฯ ที่ก่อตั้งโดยผู้สร้าง Typhoon เช่นกัน [7][8]

ผมคิดว่าเหตุผลที่ทีมตั้งใจเลือกโจทย์ภาษาไทยนั้นตรงไปตรงมา และเขียนไว้ดีในประกาศของเขา คือภาษาไทยพังสมมติฐานที่เครื่องมือภาษาโดยทั่วไปสร้างขึ้นมา

  • คำไทยเขียนติดกันไม่มีเว้นวรรค จึงต้องมีอะไรสักอย่างตัดสินว่าคำไหนจบตรงไหน
  • วรรณยุกต์เปลี่ยนความหมายของคำ
  • คนไทยสลับไทยกับอังกฤษกลางประโยค โดยมีชื่อสินค้าและตัวเลขอยู่ในลมหายใจเดียวกัน
  • เอกสารธุรกิจวางข้อความไทยอังกฤษ ตาราง ตราประทับ และลายมือ ไว้บนหน้าเดียวกัน

โมเดลทั่วไปมองสิ่งเหล่านี้เป็นกรณียกเว้น แต่สำหรับคนที่สร้างให้ผู้ใช้ไทย มันคือข้อมูลขาเข้า [1]

สองโมเดลที่คนมักสับสนว่าเป็นตัวเดียวกัน

ตารางแยกให้เห็นชัด

ตรงนี้เป็นจุดที่ผมอยากแยกให้ชัดก่อน เพราะหน้าโมเดลบน Hugging Face เขียนเตือนไว้เองว่า อย่าสับสนกับ Paxa TTS Flash [3]

หัวข้อ Paxa TTS Flash Wayu-Paxa-TTS-Edge
ลักษณะ บริการพร้อมใช้งาน ชิ้นงานวิจัยเพื่อทำซ้ำ
จำนวนเสียง 32 เสียง 12 เสียง
ขนาดโมเดล ไม่เปิดเผย 82M พารามิเตอร์
ที่รัน ผ่าน API รันบนเครื่องเองได้ รวมถึง CPU
สัญญาอนุญาต เชิงพาณิชย์ CC BY-NC 4.0
การดูแล มีทีมดูแล ไม่มีสัญญาการดูแลหรือรับประกัน

ตัวเลขทั้งหมดผมดึงจากหน้าผลิตภัณฑ์และหน้าโมเดลของทีมเอง [1][3]

หน้าโมเดลเขียนไว้ตรง ๆ ว่า Wayu-Paxa-TTS-Edge เป็น ชิ้นงานวิจัย เปิดเพื่อการทำซ้ำและงานวิจัยต่อจาก paper ไม่ใช่ผลิตภัณฑ์ ไม่มีข้อผูกพันเรื่องการดูแลหรือความพร้อมใช้งาน และไม่มีการรับประกัน [3]

และบอกด้วยว่า ถ้าคุณกำลังส่งมอบให้ผู้ใช้จริง ตัวที่คุณต้องการคือ Paxa TTS Flash [3]

ตัวเลข 32 กับ 26 ที่ยังไม่ตรงกัน

ตัวเลขขัดกันจากช่องทางของทีมเอง

จุดนี้ผมติดใจและอยากชี้ให้เห็น เพราะเป็นรายละเอียดที่คนเขียนข่าวมักข้าม

  • หน้า Voices ของเว็บไซต์และเมนูบนทุกหน้า ระบุ 32 เสียง และเขียนว่า "All 32 voices of Paxa TTS Flash on one page" [2]
  • แต่ประกาศเปิดตัวบน dev.to ระบุ 26 เสียง โดยเขียนว่า "26 voices, including Isan, Northern, and Southern regional accents and English-first voices" [1]
  • โพสต์ TikTok ที่ผมเห็นเป็นจุดตั้งต้นของการค้นครั้งนี้ พูดว่า 32 เสียง [4]

ทั้งสองตัวเลขมาจากช่องทางของทีมเอง ผมจึงยังไม่ยืนยันได้ว่าอันไหนคือจำนวนจริงในปัจจุบัน หรือว่ามีการเพิ่มเสียงระหว่างที่ประกาศกับหน้าเว็บไม่ตรงกัน

ส่วนที่ผมยืนยันได้ คือหน้าเว็บที่ขายบริการอยู่ตอนนี้แสดง 32 และผมเปิดดูรายชื่อเสียงจริงบนหน้านั้นได้ [2]

เสียงที่ตั้งชื่อตามของหวานและของกินไทย

รายชื่อเสียงของทีมนี้เป็นรายละเอียดที่ผมชอบที่สุด และความน่ารักของชื่อก็เป็นแค่ส่วนหนึ่ง

khanomkrok    ขนมครก     ชาย · เสียงหลัก · ผู้ใหญ่ สุขุม
nomyen        นมเย็น     หญิง · เสียงหลัก · สดใส คล่องตัว
tako          ตะโก้       หญิง · นักเล่าเรื่อง
foithong      ฝอยทอง     หญิง · ผู้บรรยาย
massaman      มัสมั่น     ชาย · เสียงพระเอก
thongek       ทองเอก     ชาย · ผู้ประกาศข่าว
panang        พะแนง      ชาย · แนวละครเวที
oliang        โอเลี้ยง    ชาย · วิทยุกลางคืน
sanaechan     เสน่ห์จันทน์ หญิง · แสงยามค่ำ
tubtimkrob    ทับทิมกรอบ  หญิง · อ่านแบบใกล้ชิด
mooping       หมูปิ้ง     ชาย · พลังข้างถนน
bualoi        บัวลอย     หญิง · เสียงวัยรุ่น
lukchup       ลูกชุบ     หญิง · เสียงตัวละคร
lodchong      ลอดช่อง    หญิง · แนวสงบ
Enter fullscreen mode Exit fullscreen mode

รหัสที่เห็นในคอลัมน์แรกคือค่าที่ส่งในฟิลด์ voice ของ API ผมดึงรายชื่อนี้จากหน้า Voices ของทีมเอง [2]

หน้า Voices ระบุว่ามี เสียงสำเนียงถิ่นอีสาน เหนือ และใต้ รวมอยู่ด้วย และมี เสียงที่ออกแบบมาสำหรับอังกฤษเป็นหลัก [1][2]

ผมคิดว่ารายชื่อนี้บอกอะไรบางอย่าง คือทีมเลือกชื่อที่คนไทยอ่านแล้วเข้าใจทันทีว่าคาแรกเตอร์เป็นแบบไหน ซึ่งเป็นวิธีออกแบบที่ต่างจากโมเดลต่างประเทศที่มักใช้รหัสแบบ th-TH-Standard-A

ส่วนเบื้องหลังที่ผมคิดว่ามีค่าที่สุด

ทางที่สามที่ paper เสนอ

นี่คือส่วนที่ทำให้ผมอยากเขียนบทความนี้ และผมคิดว่าสำคัญกว่าตัวผลิตภัณฑ์

ทีมตีพิมพ์ paper วิชาการเมื่อวันที่ 3 กันยายน 2026 บน arXiv เลขที่ 2609.03502 ชื่อ Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech โดย Kunat Pipatanakul และผู้เขียนร่วมอีก 5 คน [9]

paper เริ่มจากปัญหาที่ผมคิดว่าเฉียบ นั่นคือในภาษาที่มีข้อมูลน้อย การจะใช้ TTS ต้องเลือกอย่างใดอย่างหนึ่ง [9]

  • ใช้โมเดลโคลนเสียงขนาดใหญ่ แต่การประมวลผลแพง
  • หรือใช้ระบบเสียงประจำตัวที่เล็ก แต่ต้องมีคลังเสียงของคนที่พูดจริง

ทีมเสนอทางที่สาม คือ ใช้โมเดลโคลนเสียงขนาดใหญ่เป็นแหล่งข้อมูลที่สั่งงานได้ แล้วเปลี่ยนเสียงอ้างอิงสั้น ๆ ราว 15 วินาที ให้กลายเป็นโมเดลนักเรียนเสียงประจำตัวที่เล็กกว่า ซึ่งเทรนบนเสียงสังเคราะห์ทั้งหมด [9]

ประโยคที่ทีมเขียนไว้มีน้ำหนักมาก และผมคิดว่าควรยกมาตรง ๆ

"การตั้งค่าแบบนี้ทำให้การออกแบบไปป์ไลน์มีผลตามมา ความผิดพลาดของโมเดลครูกลายเป็นเป้าของการฝึก ในขณะที่การกรองรุ่นที่ล้มเหลวออก อาจลดความครอบคลุมของข้อความที่ยาก" [9]

ผมอ่านประโยคนี้แล้วคิดว่านี่คือคำเตือนที่ตรงไปตรงมาและหาได้ยากในงานวิชาการทั่วไป เพราะมันบอกข้อเสียของวิธีตัวเองไว้ตั้งแต่ย่อหน้าแรก

ตัวเลขที่วัดได้ และคำเตือนของทีมเอง

ตารางผลลัพธ์ที่ตรวจได้ทุกตัว

ผลลัพธ์ที่ทีมรายงานนั้นตรวจได้ทุกตัว และมีคำเตือนกำกับที่ผมคิดว่าสำคัญ [9]

โมเดล Wayu-Paxa-TTS-Edge    82M พารามิเตอร์ · 12 เสียง · 24 kHz

ความแม่นคำในชุดทดสอบยาก      68.2%   (เทียบเท่า 85.5% ของ Gemini 3.1)
ความแม่นตำแหน่งหยุด         91.4%   (ดีกว่าโมเดลครู OmniVoice 89.9%)
                              (เทียบเท่า 94.8% ของ Gemini 3.1)
CER ภาษาไทย                   3.7%
CER ภาษาอังกฤษ                1.1%
Enter fullscreen mode Exit fullscreen mode

คำเตือนที่ทีมเขียนไว้บนหน้าโมเดลมีสองข้อที่ผมคิดว่าสำคัญ [3]

  • ชุดทดสอบความแม่นคำมี 1,531 ประโยค แต่ระบบที่สมบูรณ์แบบก็ทำคะแนนได้ไม่ถึง 100% เพราะ ASR ที่ใช้ให้คะแนนอาจเขียนคำพ้องเสียงของคำที่ออกเสียงถูกอยู่แล้ว ⇒ ทีมจึงเขียนว่าให้ เทียบระบบกับระบบ อย่าเทียบกับ 100%
  • เสียงทั้ง 12 เป็นเสียงสังเคราะห์ ซึ่งกลั่นจากโมเดลโคลนเสียงแบบ zero-shot และ ไม่มีเส้นทางการโคลนเสียงในระบบนี้ ⇒ เพราะโมเดลครูถูกเทรนจากเสียงจริงในสภาพแวดล้อมทั่วไป ⇒ ทีมระบุว่าเสียงสังเคราะห์เหล่านี้อาจบังเอิญคล้ายบุคคลจริง โดยที่ทีมไม่ได้เก็บข้อมูลเสียงหรือตั้งใจโคลนใคร

ผมคิดว่าคำเตือนข้อหลังนี้คือความซื่อตรงที่ผมไม่เจอบ่อย และควรมีอยู่ในทุกผลิตภัณฑ์เสียง

จุดที่ตัวเลขนี้ไม่ได้บอก

ตัวเลขนี้วัดอะไร และไม่ได้วัดอะไร

ผมอยากแยกให้ชัดว่าตัวเลข 68.2% และ 91.4% วัดจากอะไร และไม่ได้วัดจากอะไร

  • 68.2% คือความแม่นของคำยากในประโยค ไม่ใช่ความแม่นของทั้งประโยค ⇒ ทีมออกแบบชุดนี้ให้มีคำยากหนึ่งคำต่อประโยค เช่น ชื่อแบรนด์ ชื่อคน คำประสมหายาก หรือคำที่เขียนแบบแชต
  • 91.4% คือความแม่นของตำแหน่งที่ระบบหยุดหายใจ ⇒ ไม่ได้วัดว่าน้ำเสียงฟังเป็นธรรมชาติแค่ไหน
  • ทั้ง 68.2% และ 91.4% เป็นงานวิจัยของทีมเอง ⇒ ไม่ใช่การทดสอบโดยองค์กรอิสระ

และในตารางที่หน้าเว็บวิจัยแสดงไว้ ผมเห็นว่ามีการเทียบกับ OmniVoice ซึ่งเป็นโมเดลครูของตัวเอง ผมคิดว่าการที่โมเดลนักเรียนทำได้ดีกว่าครูในด้านตำแหน่งหยุด เป็นผลที่น่าสนใจ แต่ก็ไม่ใช่การเทียบกับ TTS เชิงพาณิชย์รายอื่น [9]

ราคาและสิ่งที่ต้องรู้ก่อนใช้

เครดิตและแผนรายเดือน

ทีมคิดเงินเป็นเครดิต โดย 1,000 เครดิตเท่ากับ 1 ดอลลาร์ และทุกรุ่นใช้ระบบเครดิตเดียวกัน [1]

ข้อความเสียง (TTS)      15 ดอลลาร์ ต่อ 1 ล้านตัวอักษร
การแปล                 25 ดอลลาร์ ต่อ 1 ล้านตัวอักษร
OCR                    0.0065 ดอลลาร์ ต่อหน้า
Enter fullscreen mode Exit fullscreen mode

บัญชีใหม่ได้ 100 เครดิตฟรี ไม่ต้องใช้บัตร ซึ่งทีมประเมินว่าเท่ากับประมาณ 11 นาทีของเสียงพูด [10]

แผนรายเดือนเริ่มที่ 6 ดอลลาร์ ซึ่งได้ 8,100 เครดิตต่อเดือน ทีมประเมินว่าเท่ากับประมาณ 14 ชั่วโมงของเสียงพูด และมีแผน 21 ดอลลาร์ที่ได้ 25,200 เครดิต [10]

มีรายละเอียดการคิดเงินที่ผมคิดว่าน่าสนใจและทีมเขียนบทความไว้เอง คือ ระบบคิดเงินก่อนประมวลผล แล้วคืนเครดิตถ้าการประมวลผลล้มเหลว ทีมให้เหตุผลว่าเป็นลำดับที่ถูกต้อง เพราะการเรียกที่ล้มเหลวไม่ควรมีค่าใช้จ่าย [1]

และทีมมี API แบบเข้ากันได้กับ OpenAI ที่ /v1/audio/speech โค้ดเดิมที่เคยเรียก OpenAI ใช้ได้เลยถ้าเปลี่ยน base URL [1]

มุมที่ผมคิดว่าน่าสนใจที่สุดของเรื่องนี้

สามข้อที่ทำให้เรื่องนี้ต่างจากข่าวเปิดตัว API

ทั้งหมดที่เล่ามามีรายละเอียดทางเทคนิคอยู่ไม่กี่บรรทัด ผมจึงอยากปิดด้วยสิ่งที่ทำให้เรื่องนี้ต่างจากข่าวเปิดตัว API ทั่วไป

หนึ่ง · ทีมเปิดทั้งงานวิจัยและ weights โมเดล 82M ที่รันบน CPU ได้ไม่ใช่ตัวเดียวกับที่ขาย แต่การที่ทีมเปิดมันพร้อมชุดทดสอบและกรอบการประเมินให้คนอื่นใช้ต่อ ผมคิดว่าเปลี่ยนบทสนทนาจากการโฆษณาเป็นการตรวจสอบได้ [3][7]

สอง · ชุดทดสอบที่ทีมสร้างคือของขวัญที่แท้จริง thai-tts-keyword-bench มี 1,531 ประโยค และ thai-tts-pause-bench มี 210 ประโยค ทั้งคู่เปิดให้ใช้ ประโยคเหล่านี้คือสิ่งที่ทีมบอกว่าโมเดลเสียงไทยมักทำผิด [7]

สาม · ปัญหาที่ทีมเลือกแก้เป็นปัญหาที่คนไทยเจอจริง การตัดคำในภาษาที่ไม่เว้นวรรค วรรณยุกต์ ชื่อเฉพาะ และการสลับไทยอังกฤษ ทั้งหมดนี้อยู่ในรายการข้อจำกัดที่ทีมระบุเองตั้งแต่ประกาศเปิดตัว [1]

ส่วนคำถามที่ผมยังไม่มีคำตอบ คือในเมื่อทีมเปิดชุดทดสอบและกรอบการประเมินให้ทุกคนใช้ อีกไม่นานเราจะเห็นตัวเลขแบบเดียวกันจากโมเดลเสียงไทยเจ้าอื่นไหม หรือชุดทดสอบนี้จะกลายเป็นมาตรฐานที่เจ้าอื่นเลือกไม่วัดด้วย เพราะไม่ใช่การทดสอบที่ตัวเองทำ


ถ้าคุณอยากลองก่อนตัดสินใจ หน้า paxalabs.com/tts ให้พิมพ์ข้อความและเล่นเสียงได้ทันทีโดยไม่ต้องมีบัญชี และเสียงที่ได้มาจากโมเดลตัวเดียวกับที่ API ใช้ [2]

ถ้าคุณเป็นนักพัฒนา ผมแนะนำให้เริ่มจาก API แบบเข้ากันได้กับ OpenAI เพราะโค้ดเดิมใช้ได้เลย ซึ่งเร็วกว่าการเขียน client ใหม่ [1]

และถ้าคุณสนใจงานวิจัย paper วันที่ 3 กันยายน อ่านได้ฟรีทั้งฉบับ รวมถึงตารางเปรียบเทียบระบบทั้งสาม พร้อมคำอธิบายว่าที่ไหนครูยังทำได้ดีกว่านักเรียน [9]

แหล่งอ้างอิง

[1] DEV Community — "Introducing Paxa Labs" (Paxa Labs) — จำนวนเสียง 26 · ราคา TTS 15 ดอลลาร์/1M ตัวอักษร · แผนรายเดือน · OpenAI-compatible endpoint · ประโยค "26 voices, including Isan, Northern, and Southern regional accents", 28 สิงหาคม 2026 — https://dev.to/paxalabs/introducing-paxa-labs-neo

[2] Paxa Labs — หน้า Voices ("All 32 voices of Paxa TTS Flash" · รายชื่อเสียงและรหัส API · เสียงสำเนียงอีสาน เหนือ ใต้), กันยายน 2026 — https://paxalabs.com/voices

[3] Hugging Face — wayu-ai/wayu-paxa-tts-edge (82M พารามิเตอร์ · 12 เสียง · 24 kHz · CC BY-NC 4.0 · คำเตือน "Not to be confused with Paxa TTS Flash" และคำเตือนเรื่องคะแนน 100% กับเสียงสังเคราะห์), สิงหาคม 2026 — https://huggingface.co/wayu-ai/wayu-paxa-tts-edge

[4] TikTok — @peesamac โพสต์แนะนำ Paxa TTS Flash (ระบุ 32 เสียง · สำเนียงอีสาน เหนือ ใต้ · ต่อ MCP เข้า Claude Code ได้ · 100 เครดิตฟรี), กันยายน 2026 — https://www.tiktok.com/@peesamac/video/7687122241884048658

[5] arXiv — "Typhoon T1: An Open Thai Reasoning Model" (Pittawat Taveekitworachai, Potsawee Manakul, Kasima Tharnpipitchai, Kunat Pipatanakul · SCB 10X R&D), 2025 — https://arxiv.org/html/2502.09042v2

[6] kunatp.com — หน้าผลงานของ Kunat Pipatanakul (Principal Research Scientist, Typhoon Team · สมาชิกผู้ก่อตั้งทีม Typhoon), 2026 — https://www.kunatp.com/work

[7] Paxa Labs — หน้า Research (รายชื่อ paper ทั้งสองฉบับ · รายการโมเดลและชุดทดสอบที่เปิดให้ใช้ · "Three of the twelve teacher voices. None was recorded."), กันยายน 2026 — https://paxalabs.com/research

[8] Wayu Research — หน้าแรก (ห้องวิจัยไม่แสวงกำไรในกรุงเทพฯ ก่อตั้งโดยผู้สร้าง Typhoon), 2026 — https://wayuresearch.com

[9] arXiv — "Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech" (Kunat Pipatanakul และอีก 5 คน · Wayu Research · Paxa Labs · Typhoon), arXiv:2609.03502 [cs.CL] · 18 หน้า · ส่งเมื่อ 3 กันยายน 2026 — https://arxiv.org/abs/2609.03502

[10] Paxa Labs — หน้า Pricing (100 credits ≈ 11 minutes of text to speech · 8,100 credits/เดือน ≈ 14 hours · 25,200 credits ≈ 46 hours · 1,000 credits = 1 ดอลลาร์ · 100 เครดิตฟรีไม่ต้องใช้บัตร · ระบบคิดเงินก่อนประมวลผลและคืนเมื่อล้มเหลว), กันยายน 2026 — https://paxalabs.com/pricing

Top comments (0)