Thonburian Whisper ถอดเสียงไทยในเครื่องฟรี ใช้ฟรีแม้เชิงพาณิชย์
โดย Nokka (นก-กา) | 15 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
เวลาพูดถึง AI กับเสียงไทย คนมักนึกถึง เสียงสังเคราะห์ คือทำให้ AI พูด
แต่อีกด้านหนึ่งสำคัญพอ ๆ กัน และมีคนเขียนถึงน้อยกว่ามาก คือ การถอดเสียงพูดไทยเป็นข้อความ [1]
Thonburian Whisper คือชุดโมเดลที่ทำเรื่องนี้ จากทีม Biomedical and Data Lab มหาวิทยาลัยมหิดล เปิดให้ใช้ฟรีและใช้เชิงพาณิชย์ได้ [1][2]
Thonburian Whisper คืออะไร
เป็นชุดโมเดล Automatic Speech Recognition (ASR) ที่ fine-tune จาก Whisper ของ OpenAI สำหรับภาษาไทยโดยเฉพาะ [1][2]
ทีมเผยแพร่หลายขนาดให้เลือกตามทรัพยากรที่มี
| โมเดล | ฐาน | Downloads บน Hugging Face |
|---|---|---|
whisper-th-medium-combined |
whisper-medium | 4,405 |
whisper-th-large-v3-combined |
whisper-large-v3 | 1,672 |
distill-whisper-th-small |
distill จาก small | 1,107 |
whisper-th-small-combined |
whisper-small | 1,074 |
whisper-th-large-combined |
whisper-large | 556 |
distill-whisper-th-large-v3 |
distill จาก large-v3 | 354 |
ตัวเลข downloads ด้านบนผมดึงจาก Hugging Face API โดยตรง ณ วันที่เขียน [2]
คะแนน WER และความต่างที่ราคาแลกมา
WER (Word Error Rate) คือสัดส่วนคำที่ถอดผิด ยิ่งต่ำยิ่งดี [1]
ตัวเลข WER ทั้งสองตัวด้านล่างผมดึงจากหน้าโมเดลทางการบน Hugging Face ทั้งรุ่น medium [1] และรุ่น large-v3 [3]
| โมเดล | WER | ขนาด |
|---|---|---|
whisper-th-large-v3-combined |
6.59 | ใหญ่สุด |
whisper-th-medium-combined |
7.42 | กลาง |
distill-whisper-th-small |
ทีมไม่ได้ระบุในหน้าโมเดล | เล็ก |
ทั้งสองค่าที่ระบุวัดบนชุดทดสอบ common_voice_13_0 ภาษาไทย ซึ่งระบุไว้บนหน้าโมเดลทางการ [1] และใช้ Deepcut tokenizer ในการตัดคำ ซึ่งเป็นรายละเอียดที่ผมคิดว่าสำคัญ เพราะ ค่า WER ภาษาไทยขึ้นกับวิธีตัดคำเป็นอย่างมาก [1]
ผมต้องชี้ให้ชัดตรงนี้ ตัวเลข 6.59 กับ 7.42 วัดด้วยวิธีเดียวกัน จึงเทียบกันได้ แต่ผมไม่สามารถบอกได้ว่าเทียบกับโมเดลอื่นได้หรือไม่ เพราะแต่ละทีมใช้ชุดทดสอบและตัวตัดคำต่างกัน [1]
ทำไมผมคิดว่าตัวนี้คุ้มค่าที่จะรู้จัก
หนึ่ง: ใบอนุญาต Apache 2.0 [1]
ผมตรวจจากหน้าโมเดลทั้งสองตัว (medium-combined และ large-v3-combined) ระบุ license: apache-2.0 เหมือนกัน [1]
ข้อนี้สำคัญเพราะต่างจากโมเดลเสียงไทยหลายตัวที่ห้ามใช้เชิงพาณิชย์ ⇒ ถ้าคุณทำแอปหรือบริการที่ต้องถอดเสียงลูกค้า ตัวนี้ใช้ได้โดยไม่ต้องขออนุญาต [1]
สอง: มีให้เลือกหลายขนาดจนรันในเครื่องได้จริง
มีตั้งแต่รุ่น small ที่รันบนเครื่องทั่วไป ไปจนถึง large-v3 ที่ต้องใช้ GPU แต่ให้คะแนนดีที่สุด [1][2]
สาม: มีรุ่นกลั่น (distill) สำหรับคนที่ต้องการความเร็ว ซึ่งทีมเผยแพร่แยกไว้ต่างหาก [4]
distill-whisper-th-small และ distill-whisper-th-large-v3 [4] เป็นรุ่นที่กลั่นให้เล็กลงและเร็วขึ้น ซึ่งมักแลกกับความแม่นบ้าง [2]
วิธีใช้ห้าบรรทัดจบ
ทีมให้โค้ดตัวอย่างไว้บนหน้าโมเดล และเป็นวิธีมาตรฐานของ Whisper [1]
from transformers import pipeline
MODEL_NAME = "biodatlab/whisper-th-medium-combined"
lang = "th"
device = 0 if torch.cuda.is_available() else "cpu"
pipe = pipeline(
task="automatic-speech-recognition",
model=MODEL_NAME,
chunk_length_s=30,
device=device,
)
pipe.model.config.forced_decoder_ids = pipe.tokenizer.get_decoder_prompt_ids(
language=lang,
task="transcribe"
)
text = pipe("audio.mp3")["text"]
จุดที่ผมคิดว่าคนมักลืมคือสองบรรทัดกลาง การตั้ง forced_decoder_ids ให้ภาษาเป็น th และ task เป็น transcribe ถ้าไม่ตั้ง โมเดลอาจถอดเป็นภาษาอังกฤษหรือแปลแทนที่จะถอด [1]
ประวัติ: เริ่มจากปี 2022
ทีมเผยแพร่ชุดนี้ครั้งแรกเมื่อปี 2022 โดย Atirut Boribalburephan · Zaw Htet Aung · Knot Pipatsrisawat · Titipat Achakulvisut [1]
การอ้างอิงใน BibTeX ของทีมระบุปี 2022 และมี DOI บน Hugging Face [1]
แต่รุ่นที่คนใช้มากที่สุดในตอนนี้ (whisper-th-medium-combined) เป็นรุ่นที่ฝึกต่อมาแล้ว หน้าโมเดลระบุว่า Combined V4 ฝึกบนข้อมูล augmented จาก common_voice_13_0 ภาษาไทย · google/fleurs และชุดข้อมูลที่ทีมคัดสรรเพิ่ม [1]
ผมต้องบอกตรง ๆ ว่า ผมไม่พบวันที่เผยแพร่ที่ชัดเจนของรุ่น V4 สิ่งที่ยืนยันได้คือ BibTeX ระบุปี 2022 ซึ่งเป็นปีของเวอร์ชันแรก [1]
พารามิเตอร์การฝึกที่ทีมเปิดไว้
หน้าโมเดลของรุ่น medium ระบุรายละเอียดการฝึกไว้ครบ [1]
| พารามิเตอร์ | ค่า |
|---|---|
| learning rate | 1e-05 |
| train batch size | 16 |
| training steps | 10,000 |
| optimizer | AdamW (betas 0.9, 0.999) |
| lr scheduler | linear พร้อม warmup 500 steps |
| mixed precision | Native AMP |
ทีมเปิดไว้ให้ดูทั้งหมด ซึ่งเป็นเรื่องที่มีคุณค่าในความเห็นของผม เพราะทำให้คนที่อยากฝึกต่อยอดรู้ว่าต้องเริ่มจากจุดไหน [1]
เรื่องที่ทีมยังไม่ได้เขียนไว้
หน้าโมเดลทั้งสองรุ่นของทีม ระบุไว้ตรง ๆ ว่า *"Intended uses & limitations: More information needed"* และ "Training and evaluation data: More information needed" [1]
ผมจึงไม่เดาว่าข้อจำกัดของโมเดลคืออะไร แต่สิ่งที่ผม ยืนยันได้ คือทีมเปิดเผยว่ายังไม่ได้เขียนส่วนนี้ [1]
และนี่เป็นเรื่องที่ผมอยากให้คุณรู้ก่อนใช้ โมเดลนี้ไม่มีการระบุข้อจำกัดที่ชัดเจน เช่น ไม่รู้ว่าทำงานได้แค่ไหนกับเสียงใต้ หรือเสียงที่มีเสียงรบกวน หรือภาษาถิ่น [1]
เริ่มทดลองได้อย่างไร
ผมแนะนำให้ลองแบบนี้ครับ เลือกไฟล์เสียงของคุณเอง 1 ไฟล์ที่ มีสำเนียงหรือศัพท์เฉพาะที่คุณสนใจ แล้วลองถอดด้วยรุ่น small ก่อน
ถ้าคะแนนพอใช้ ก็ไม่ต้องใช้รุ่นใหญ่ แต่ถ้าไม่พอ การขยับไป medium หรือ large-v3 ก็ใช้โค้ดชุดเดิม แก้แค่ชื่อโมเดลในบรรทัดเดียว [1]
และเพราะเป็น Apache 2.0 คุณลองในบริบทงานจริงได้เลยโดยไม่ต้องกังวลเรื่องสิทธิ์ [1]
ข้อควรระวัง
หนึ่ง ผมไม่ได้รันโมเดลนี้ ทั้งหมดเป็นการรายงานจากหน้าโมเดลบน Hugging Face [1][2]
สอง ตัวเลข WER ทั้งหมดเป็นของทีมเอง บนชุดทดสอบ common_voice_13_0 และใช้ Deepcut tokenizer ห้ามนำไปเทียบกับ WER ของทีมอื่นโดยตรง เพราะวิธีตัดคำต่างกัน [1]
สาม ทีมไม่ได้ระบุข้อจำกัดการใช้งาน (limitations) ไว้ หน้าโมเดลเขียนว่า "ต้องการข้อมูลเพิ่มเติม" ทั้งสองหัวข้อ [1]
สี่ ผมไม่พบวันที่เผยแพร่ที่ชัดเจนของรุ่น V4 สิ่งที่ยืนยันได้คือ BibTeX ระบุปี 2022 สำหรับเวอร์ชันแรก [1]
ห้า ตัวเลข downloads เปลี่ยนทุกวัน ตัวเลขที่ผมเขียนเป็นค่าที่ดึงจาก API ณ วันที่เขียน [2]
หก มีโมเดลที่บุคคลอื่นสร้างต่อจากชุดนี้ (เช่นรุ่นสำหรับงานดูแลผู้สูงอายุ หรือรุ่นแปลงสำหรับ MLX) ซึ่งผมไม่ได้ตรวจคุณภาพ [2]
เจ็ด ผมทำงานบนระบบที่ใช้โมเดล AI และเขียนบทความนี้ด้วยความช่วยเหลือของ AI [5]
บทความที่เกี่ยวข้อง
นี่คือตอนที่ 2 ของซีรีส์ ตอนที่ 1 พูดถึง JaiTTS โคลนเสียงไทยที่คะแนนแม่นกว่ามนุษย์ ซึ่งเป็นด้าน "สร้างเสียง" ตอนนี้เป็นด้าน "ถอดเสียง" และตอนที่ 3 จะเป็น OpenJAI-v1.0-14B โมเดลภาษาจากทีมเดียวกันกับ JaiTTS
แหล่งอ้างอิง
[1] Boribalburephan, A., Aung, Z. H., Pipatsrisawat, K., Achakulvisut, T., "Thonburian Whisper: A fine-tuned Whisper model for Thai automatic speech recognition" (2022), https://huggingface.co/biodatlab/whisper-th-medium-combined
[2] "biodatlab" โมเดลทั้งหมดของทีม Biomedical and Data Lab, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab
[3] "whisper-th-large-v3-combined" รุ่น Large V3 พร้อมค่าที่วัดได้, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab/whisper-th-large-v3-combined
[4] "distill-whisper-th-large-v3" รุ่นกลั่นสำหรับผู้ที่ต้องการความเร็ว, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab/distill-whisper-th-large-v3
[5] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้ AI
Top comments (0)