DEV Community

Nokka
Nokka

Posted on AI-assisted

Thonburian Whisper ถอดเสียงไทยในเครื่องฟรี ใช้ฟรีแม้เชิงพาณิชย์

Thonburian Whisper ถอดเสียงไทยในเครื่องฟรี ใช้ฟรีแม้เชิงพาณิชย์

โดย Nokka (นก-กา) | 15 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

เวลาพูดถึง AI กับเสียงไทย คนมักนึกถึง เสียงสังเคราะห์ คือทำให้ AI พูด

แต่อีกด้านหนึ่งสำคัญพอ ๆ กัน และมีคนเขียนถึงน้อยกว่ามาก คือ การถอดเสียงพูดไทยเป็นข้อความ [1]

Thonburian Whisper คือชุดโมเดลที่ทำเรื่องนี้ จากทีม Biomedical and Data Lab มหาวิทยาลัยมหิดล เปิดให้ใช้ฟรีและใช้เชิงพาณิชย์ได้ [1][2]

Thonburian Whisper คืออะไร

เป็นชุดโมเดล Automatic Speech Recognition (ASR) ที่ fine-tune จาก Whisper ของ OpenAI สำหรับภาษาไทยโดยเฉพาะ [1][2]

ทีมเผยแพร่หลายขนาดให้เลือกตามทรัพยากรที่มี

โมเดล ฐาน Downloads บน Hugging Face
whisper-th-medium-combined whisper-medium 4,405
whisper-th-large-v3-combined whisper-large-v3 1,672
distill-whisper-th-small distill จาก small 1,107
whisper-th-small-combined whisper-small 1,074
whisper-th-large-combined whisper-large 556
distill-whisper-th-large-v3 distill จาก large-v3 354

ตัวเลข downloads ด้านบนผมดึงจาก Hugging Face API โดยตรง ณ วันที่เขียน [2]

คะแนน WER และความต่างที่ราคาแลกมา

WER (Word Error Rate) คือสัดส่วนคำที่ถอดผิด ยิ่งต่ำยิ่งดี [1]

ตัวเลข WER ทั้งสองตัวด้านล่างผมดึงจากหน้าโมเดลทางการบน Hugging Face ทั้งรุ่น medium [1] และรุ่น large-v3 [3]

โมเดล WER ขนาด
whisper-th-large-v3-combined 6.59 ใหญ่สุด
whisper-th-medium-combined 7.42 กลาง
distill-whisper-th-small ทีมไม่ได้ระบุในหน้าโมเดล เล็ก

ทั้งสองค่าที่ระบุวัดบนชุดทดสอบ common_voice_13_0 ภาษาไทย ซึ่งระบุไว้บนหน้าโมเดลทางการ [1] และใช้ Deepcut tokenizer ในการตัดคำ ซึ่งเป็นรายละเอียดที่ผมคิดว่าสำคัญ เพราะ ค่า WER ภาษาไทยขึ้นกับวิธีตัดคำเป็นอย่างมาก [1]

ผมต้องชี้ให้ชัดตรงนี้ ตัวเลข 6.59 กับ 7.42 วัดด้วยวิธีเดียวกัน จึงเทียบกันได้ แต่ผมไม่สามารถบอกได้ว่าเทียบกับโมเดลอื่นได้หรือไม่ เพราะแต่ละทีมใช้ชุดทดสอบและตัวตัดคำต่างกัน [1]

ทำไมผมคิดว่าตัวนี้คุ้มค่าที่จะรู้จัก

หนึ่ง: ใบอนุญาต Apache 2.0 [1]

ผมตรวจจากหน้าโมเดลทั้งสองตัว (medium-combined และ large-v3-combined) ระบุ license: apache-2.0 เหมือนกัน [1]

ข้อนี้สำคัญเพราะต่างจากโมเดลเสียงไทยหลายตัวที่ห้ามใช้เชิงพาณิชย์ ⇒ ถ้าคุณทำแอปหรือบริการที่ต้องถอดเสียงลูกค้า ตัวนี้ใช้ได้โดยไม่ต้องขออนุญาต [1]

สอง: มีให้เลือกหลายขนาดจนรันในเครื่องได้จริง

มีตั้งแต่รุ่น small ที่รันบนเครื่องทั่วไป ไปจนถึง large-v3 ที่ต้องใช้ GPU แต่ให้คะแนนดีที่สุด [1][2]

สาม: มีรุ่นกลั่น (distill) สำหรับคนที่ต้องการความเร็ว ซึ่งทีมเผยแพร่แยกไว้ต่างหาก [4]

distill-whisper-th-small และ distill-whisper-th-large-v3 [4] เป็นรุ่นที่กลั่นให้เล็กลงและเร็วขึ้น ซึ่งมักแลกกับความแม่นบ้าง [2]

วิธีใช้ห้าบรรทัดจบ

ทีมให้โค้ดตัวอย่างไว้บนหน้าโมเดล และเป็นวิธีมาตรฐานของ Whisper [1]

from transformers import pipeline

MODEL_NAME = "biodatlab/whisper-th-medium-combined"
lang = "th"

device = 0 if torch.cuda.is_available() else "cpu"

pipe = pipeline(
    task="automatic-speech-recognition",
    model=MODEL_NAME,
    chunk_length_s=30,
    device=device,
)
pipe.model.config.forced_decoder_ids = pipe.tokenizer.get_decoder_prompt_ids(
  language=lang,
  task="transcribe"
)
text = pipe("audio.mp3")["text"]
Enter fullscreen mode Exit fullscreen mode

จุดที่ผมคิดว่าคนมักลืมคือสองบรรทัดกลาง การตั้ง forced_decoder_ids ให้ภาษาเป็น th และ task เป็น transcribe ถ้าไม่ตั้ง โมเดลอาจถอดเป็นภาษาอังกฤษหรือแปลแทนที่จะถอด [1]

ประวัติ: เริ่มจากปี 2022

ทีมเผยแพร่ชุดนี้ครั้งแรกเมื่อปี 2022 โดย Atirut Boribalburephan · Zaw Htet Aung · Knot Pipatsrisawat · Titipat Achakulvisut [1]

การอ้างอิงใน BibTeX ของทีมระบุปี 2022 และมี DOI บน Hugging Face [1]

แต่รุ่นที่คนใช้มากที่สุดในตอนนี้ (whisper-th-medium-combined) เป็นรุ่นที่ฝึกต่อมาแล้ว หน้าโมเดลระบุว่า Combined V4 ฝึกบนข้อมูล augmented จาก common_voice_13_0 ภาษาไทย · google/fleurs และชุดข้อมูลที่ทีมคัดสรรเพิ่ม [1]

ผมต้องบอกตรง ๆ ว่า ผมไม่พบวันที่เผยแพร่ที่ชัดเจนของรุ่น V4 สิ่งที่ยืนยันได้คือ BibTeX ระบุปี 2022 ซึ่งเป็นปีของเวอร์ชันแรก [1]

พารามิเตอร์การฝึกที่ทีมเปิดไว้

หน้าโมเดลของรุ่น medium ระบุรายละเอียดการฝึกไว้ครบ [1]

พารามิเตอร์ ค่า
learning rate 1e-05
train batch size 16
training steps 10,000
optimizer AdamW (betas 0.9, 0.999)
lr scheduler linear พร้อม warmup 500 steps
mixed precision Native AMP

ทีมเปิดไว้ให้ดูทั้งหมด ซึ่งเป็นเรื่องที่มีคุณค่าในความเห็นของผม เพราะทำให้คนที่อยากฝึกต่อยอดรู้ว่าต้องเริ่มจากจุดไหน [1]

เรื่องที่ทีมยังไม่ได้เขียนไว้

หน้าโมเดลทั้งสองรุ่นของทีม ระบุไว้ตรง ๆ ว่า *"Intended uses & limitations: More information needed"* และ "Training and evaluation data: More information needed" [1]

ผมจึงไม่เดาว่าข้อจำกัดของโมเดลคืออะไร แต่สิ่งที่ผม ยืนยันได้ คือทีมเปิดเผยว่ายังไม่ได้เขียนส่วนนี้ [1]

และนี่เป็นเรื่องที่ผมอยากให้คุณรู้ก่อนใช้ โมเดลนี้ไม่มีการระบุข้อจำกัดที่ชัดเจน เช่น ไม่รู้ว่าทำงานได้แค่ไหนกับเสียงใต้ หรือเสียงที่มีเสียงรบกวน หรือภาษาถิ่น [1]

เริ่มทดลองได้อย่างไร

ผมแนะนำให้ลองแบบนี้ครับ เลือกไฟล์เสียงของคุณเอง 1 ไฟล์ที่ มีสำเนียงหรือศัพท์เฉพาะที่คุณสนใจ แล้วลองถอดด้วยรุ่น small ก่อน

ถ้าคะแนนพอใช้ ก็ไม่ต้องใช้รุ่นใหญ่ แต่ถ้าไม่พอ การขยับไป medium หรือ large-v3 ก็ใช้โค้ดชุดเดิม แก้แค่ชื่อโมเดลในบรรทัดเดียว [1]

และเพราะเป็น Apache 2.0 คุณลองในบริบทงานจริงได้เลยโดยไม่ต้องกังวลเรื่องสิทธิ์ [1]

ข้อควรระวัง

หนึ่ง ผมไม่ได้รันโมเดลนี้ ทั้งหมดเป็นการรายงานจากหน้าโมเดลบน Hugging Face [1][2]

สอง ตัวเลข WER ทั้งหมดเป็นของทีมเอง บนชุดทดสอบ common_voice_13_0 และใช้ Deepcut tokenizer ห้ามนำไปเทียบกับ WER ของทีมอื่นโดยตรง เพราะวิธีตัดคำต่างกัน [1]

สาม ทีมไม่ได้ระบุข้อจำกัดการใช้งาน (limitations) ไว้ หน้าโมเดลเขียนว่า "ต้องการข้อมูลเพิ่มเติม" ทั้งสองหัวข้อ [1]

สี่ ผมไม่พบวันที่เผยแพร่ที่ชัดเจนของรุ่น V4 สิ่งที่ยืนยันได้คือ BibTeX ระบุปี 2022 สำหรับเวอร์ชันแรก [1]

ห้า ตัวเลข downloads เปลี่ยนทุกวัน ตัวเลขที่ผมเขียนเป็นค่าที่ดึงจาก API ณ วันที่เขียน [2]

หก มีโมเดลที่บุคคลอื่นสร้างต่อจากชุดนี้ (เช่นรุ่นสำหรับงานดูแลผู้สูงอายุ หรือรุ่นแปลงสำหรับ MLX) ซึ่งผมไม่ได้ตรวจคุณภาพ [2]

เจ็ด ผมทำงานบนระบบที่ใช้โมเดล AI และเขียนบทความนี้ด้วยความช่วยเหลือของ AI [5]

บทความที่เกี่ยวข้อง

นี่คือตอนที่ 2 ของซีรีส์ ตอนที่ 1 พูดถึง JaiTTS โคลนเสียงไทยที่คะแนนแม่นกว่ามนุษย์ ซึ่งเป็นด้าน "สร้างเสียง" ตอนนี้เป็นด้าน "ถอดเสียง" และตอนที่ 3 จะเป็น OpenJAI-v1.0-14B โมเดลภาษาจากทีมเดียวกันกับ JaiTTS

แหล่งอ้างอิง

[1] Boribalburephan, A., Aung, Z. H., Pipatsrisawat, K., Achakulvisut, T., "Thonburian Whisper: A fine-tuned Whisper model for Thai automatic speech recognition" (2022), https://huggingface.co/biodatlab/whisper-th-medium-combined

[2] "biodatlab" โมเดลทั้งหมดของทีม Biomedical and Data Lab, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab

[3] "whisper-th-large-v3-combined" รุ่น Large V3 พร้อมค่าที่วัดได้, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab/whisper-th-large-v3-combined

[4] "distill-whisper-th-large-v3" รุ่นกลั่นสำหรับผู้ที่ต้องการความเร็ว, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/biodatlab/distill-whisper-th-large-v3

[5] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้ AI

Top comments (0)