DEV Community

Nokka
Nokka

Posted on AI-assisted

YuE2 แต่งเพลงทั้งเพลงในเครื่องคุณ แต่ร้องภาษาไทยได้จริงหรือยัง

YuE2 แต่งเพลงทั้งเพลงในเครื่องคุณ แต่ร้องภาษาไทยได้จริงหรือยัง

โดย Nokka (นก-กา) | 16 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

มีโพสต์หนึ่งที่อธิบาย YuE2 ได้เข้าใจง่ายมาก และผมคิดว่าคำอธิบายนั้นถูกเกือบทั้งหมด

"YuE2 คือ AI ที่เราป้อนเนื้อเพลง + บอกสไตล์ที่อยากได้ แล้วมันจะแต่งเพลงให้ทั้งเพลง พร้อมเสียงร้อง เสียงดนตรี จบครบ เปรียบเหมือนเรามีนักแต่งเพลง + นักดนตรี + นักร้อง อยู่ในคอมพ์ของเราเลย"

และส่วนที่เหลือของโพสต์ระบุอีกสามอย่าง คือความเปิดของโค้ด การรันบนเครื่องตัวเองโดยไม่ส่งข้อมูลขึ้นคลาวด์ และการใช้งานผ่าน ComfyUI

ผมอ่านแล้วเห็นด้วยกับแก่นของคำอธิบายนั้น แต่พอเปิดต้นทางจริงกลับพบสามจุดที่คนอ่านไทยควรรู้ก่อนโหลด เพราะจุดเหล่านี้เปลี่ยนการตัดสินใจว่าจะลองหรือไม่ลอง

เริ่มจากข้อเท็จจริงพื้นฐาน YuE2 คือโมเดลสร้างเพลงจากเนื้อร้องและคำบอกสไตล์ พัฒนาโดย Multimodal Art Projection (m-a-p) ร่วมกับ HKUST, NYU, Stanford, MBZUAI และบริษัทอย่าง NOIZ กับ ACE Studio [1][2]

ตัวโมเดลมี 3.59 พันล้านพารามิเตอร์ 28 เลเยอร์ และสร้างเสียงสเตอริโอ 48 kHz [10]

เปิดตัวเวอร์ชัน yue2-v0.1.6 เมื่อ 9 กันยายน 2026 [3]

สามจุดที่โพสต์ไม่ได้บอก และผมคิดว่าสำคัญที่สุด

หนึ่ง: คำว่า "Open-source" จริงแค่ครึ่งเดียว

นี่คือจุดที่ผมคิดว่าต้องเข้าใจก่อนเป็นอันดับแรก เพราะมันต่างกันที่ "ใช้ทำอะไรได้"

YuE2 แยกสัญญาอนุญาตออกเป็นสองส่วน [1][2]

ส่วน สัญญาอนุญาต ใช้เชิงพาณิชย์
โค้ด · agent skill · เอกสาร Apache 2.0 ได้
น้ำหนักโมเดล (weights) CC BY-NC 4.0 ไม่ได้

⇒ ตัวโปรแกรมรอบโมเดลเป็นโอเพนซอร์สจริง แต่ตัวโมเดลเองเป็น "เปิดน้ำหนักให้ใช้" แบบห้ามการค้า [1][2]

คำว่า NonCommercial ใน CC BY-NC 4.0 หมายความว่าถ้าคุณจะเอาเพลงที่สร้างไปขาย ใส่โฆษณา หรือใช้ในงานลูกค้า คุณต้องคุยเรื่องสัญญาอนุญาตกับทีมก่อน ไม่ใช่ใช้ได้เลย [2]

ผมคิดว่านี่คือจุดที่คนอ่านโพสต์จะเข้าใจผิดง่ายที่สุด เพราะประโยค "Open-source" ฟังดูเหมือนใช้ได้ทุกอย่าง

สอง: "รันบนเครื่องเราเอง" จริง แต่มีประตูอยู่ที่ 24 GB

โพสต์บอกว่ารันในเครื่องได้ ซึ่งถูก แต่ไม่ได้บอกว่าต้องใช้การ์ดระดับไหน

ข้อกำหนดที่เอกสารทางการระบุ [1][2]

"Linux · Python 3.12 · NVIDIA GPU ที่รองรับ BF16 และมี VRAM 24 GB" [2]

จุดที่ผมต้องแก้ให้ตรง สองแหล่งระบุเวอร์ชัน Python ไม่ตรงกัน คือ quick start บน GitHub เขียน Python 3.12 แต่ส่วน quick start บน model card เขียน Python 3.10+ ⇒ ผมยึดเลข 3.12 จาก GitHub เพราะเป็นตัวที่ repo ใช้จริงในคำสั่งติดตั้ง [1][2]

⇒ และระบุชัดว่าไม่ใช้ quantization หมายความว่า 24 GB คือตัวเลขจริงที่ต้องมี ไม่ใช่ตัวเลขที่ลดได้ด้วยการบีบอัด [1]

แต่มีทางออกที่ผมคิดว่าดี ถ้าการ์ดคุณไม่ถึง 24 GB

Comfy-Org ได้ทำแพ็กเกจไฟล์โมเดลสำหรับ ComfyUI แยกออกมา [4]

ตัวเลขที่ต่างจากเวอร์ชันหลัก [5]

  • ขนาดโมเดล 6.8 GiB
  • หน่วยความจำที่ต้องใช้ 8.1 GiB [5][8]
  • ระบุว่าเข้ากับการ์ด 12 GB อย่าง RTX 4070 หรือ RTX 3060 12GB [5][8]

⇒ ถ้าคุณใช้ ComfyUI อยู่แล้วและมีการ์ด 12 GB ทางนี้คือทางที่ควรลองก่อน [4][5]

และมีข้อมูลจากผู้ทดสอบอิสระที่ตรงกัน การรันจริงบนการ์ด 48 GB ใช้หน่วยความจำไม่ถึง 8 GB และเพลงยาว 212 วินาทีใช้เวลาสร้างราว 2 นาที [6]

สิ่งที่ผมยังไม่ยืนยัน ผมไม่ได้ติดตั้งและรัน YuE2 เองในเครื่องที่ผมทำงานอยู่ ตัวเลขทั้งหมดในหัวข้อนี้มาจากเอกสารทางการและผู้ทดสอบที่ผมเปิดอ่าน [1][2][4][5][6]

สาม: ภาษาไทยไม่อยู่ในรายการที่รองรับ

นี่คือจุดที่ผมคิดว่าคนอ่านไทยควรรู้ที่สุด และโพสต์ไม่ได้พูดถึง

model card ของ YuE2-3B ระบุฟิลด์ภาษาไว้แค่สองภาษา [1]

language: zh, en
Enter fullscreen mode Exit fullscreen mode

⇒ จีนกลางและอังกฤษเท่านั้น [1]

และมีรายงานที่อ้างสเปกของแพ็กเกจ ComfyUI ระบุตรงกันว่า "ภาษาที่รองรับ: จีน (zh) และอังกฤษ (en)" [5]

⚠️ หมายเหตุความแม่นยำ: ข้อความ zh/en ข้างต้นผมอ่านจาก รายงานของ Local Model Watch ซึ่งเป็นแหล่งทุติยภูมิที่สรุปจากหน้า Hugging Face ของแพ็กเกจ ไม่ใช่จากหน้า HF นั้นโดยตรง [5]

มีข้อมูลที่ดูเหมือนขัดกัน โมเดล YuE รุ่นก่อนหน้ารองรับหลายภาษากว่านี้ รวมถึงญี่ปุ่นและเกาหลี [9]

แต่ผมยึดตามเอกสารของ YuE2 เอง ซึ่งระบุว่าภาษาที่ประกาศคือ zh และ en ⇒ ถ้าคุณต้องการเพลงไทย ยังไม่มีหลักประกันว่าเสียงร้องจะออกมาฟังรู้เรื่อง

การทดสอบอิสระก็ไม่ได้ทดสอบภาษาไทย รายการภาษาที่เขาลองมี Mandarin, Russian, Polish, Hindi, Urdu, Arabic, Bengali, Spanish, Portuguese, French, German, Swedish, Indonesian, Dutch, Tagalog และ Persian [6]

⇒ และเขาสรุปว่าคุณภาพต่างกันมากตามภาษา ฝรั่งเศส โปรตุเกสบราซิล ตากาล็อก และเบงกาลีออกมาดี ขณะที่ ฮินดีกับอูรดูอ่อนชัดเจน [6]

และข้อสังเกตที่ผมคิดว่าสำคัญกับทุกภาษา [6]

"เสียงร้องยังคงคุณภาพแบบสังเคราะห์ที่จับได้ในเกือบทุกภาษา แม้เครื่องดนตรีจะฟังดูน่าเชื่อถือแล้ว ซึ่งยังเป็นจุดที่บอกได้ง่ายที่สุดว่าแทร็กนั้นสร้างโดย AI"

⇒ สรุปสั้น ๆ คือ เครื่องดนตรีทำได้ดีแล้ว แต่เสียงร้องยังเป็นจุดอ่อน และถ้าภาษาของคุณไม่อยู่ในรายการที่รองรับ ความไม่แน่นอนจะสูงขึ้นอีก [6]

กลไกที่ทำให้ YuE2 ต่างจากโมเดลสร้างเพลงตัวอื่น

นี่คือส่วนที่ผมคิดว่าน่าสนใจที่สุด และโพสต์ก็แตะไว้ถูกทาง

โมเดลสร้างเพลงทั่วไปรับข้อความแล้วคายคลื่นเสียงออกมาเป็นก้อนเดียว ปรับได้แค่แก้ prompt แล้วสุ่มใหม่ [6]

YuE2 แทรกขั้นตอนหนึ่งไว้ตรงกลาง [1][2]

เนื้อร้อง + คำบอกสไตล์
   ↓
AR-NAR Mixture-of-Transformers เขียน "โน้ตเพลง" (ABC notation)
   ↓
semantic tokens → flow matching → acoustic latents
   ↓
VAE ถอดรหัสเป็นเสียงสเตอริโอ 48 kHz
Enter fullscreen mode Exit fullscreen mode

⇒ ขั้นกลางนั้นคือคะแนนโน้ตที่อ่านได้ แก้ได้ และเล่นได้ ก่อนที่จะกลายเป็นเสียง [1]

นี่คือสิ่งที่ทีมงานเรียกว่า white-box หมายความว่าคุณดูได้ว่ามันตั้งใจจะแต่งอะไร แล้วเข้าไปแก้ก่อนเรนเดอร์ [2]

"อ่าน เล่น และเปลี่ยนองค์ประกอบก่อนเรนเดอร์เป็นเสียง ทำนองและคอร์ดกลายเป็นตัวควบคุมที่ชัดเจนที่คนหรือ agent ตรวจสอบและแก้ได้" [2]

และ API ก็แยกขั้นตามนั้นจริง ไลบรารีมีสี่คำสั่งเรียงกัน [2]

plan()  →  generate_semantic()  →  synthesize()  →  decode()
Enter fullscreen mode Exit fullscreen mode

ประโยชน์ที่จับต้องได้ ถ้าเพลงออกมาแล้วไม่ถูกใจ คุณไม่ต้องเริ่มใหม่ทั้งหมด แต่แก้ที่ตัวโน้ตแล้วเรนเดอร์ใหม่ [1][2]

มีโหมดให้เลือกสามแบบ [1][2]

  • cot="full" วางแผนทำนองและคอร์ด (ค่าเริ่มต้น)
  • cot="melody" วางแผนแค่ทำนอง แนะนำสำหรับการทำ cover
  • cot="off" สร้างตรงจากเนื้อร้องกับสไตล์ ไม่ผ่านแผน

และมี agent skill แถมมาในโปรเจกต์ด้วย ไฟล์ skills/yue2-music/SKILL.md สอน agent ให้สร้างเพลง ถอดเพลงต้นฉบับทำ cover แก้คะแนน ABC และตรวจว่าองค์ประกอบดนตรีไม่เพี้ยน [2]

ทีมงานทำเดโมการแก้เพลงไว้ให้ดูจริง เพลง "The Last Train" ผ่าน 9 ขั้นตอน 14 เวอร์ชัน จากป็อปจีนไปเป็นแจ๊สอังกฤษ พร้อมฮาร์โมนีใหม่และโซโลแซกโซโฟน [1][2]

เรื่องตัวเลข benchmark ที่ต้องอ่านให้ครบ

โพสต์ไม่ได้อ้างเรื่องนี้ แต่ผมคิดว่าจำเป็น เพราะเป็นจุดที่คนนำไปพูดต่อกันเยอะที่สุด

YuE2 อ้างผลบน WildSongBench 192 prompt ตารางนี้ผมยกมาเฉพาะบางแถว ไม่ใช่ทั้ง 17 การตั้งค่าในรายงานต้นฉบับ [1]

โมเดล SongBench เฉลี่ย
YuE2 (best-of-8) 6.9632
Mureka 9 6.9377
Suno v5 6.8721
YuE2 (ไม่เลือก best-of) 6.7316
Suno v5.5 6.7150
Suno v6 6.5562
Suno v6 Wild 6.4195

อ่านตารางนี้แล้วมีสามเรื่องที่ผมคิดว่าต้องพูดตรง ๆ

หนึ่ง ตัวเลขที่ทีมงานยกเป็นหัวข้อคือ best-of-8 ซึ่งหมายถึงสร้างแปดครั้งแล้วเลือกที่ดีที่สุด ⇒ ส่วนแถวที่ผมเขียนว่า "ไม่เลือก best-of" คือ 6.7316 ซึ่งอยู่ ต่ำกว่า Mureka 9 และ Suno v5 [1]

และผมต้องแก้ความแม่นของตัวเองตรงนี้ แถว 6.7316 ไม่ใช่ "รันครั้งเดียว" แต่เป็น best-of-2 คือสร้างสองครั้งแล้วเลือกตัวที่ค่า PER ต่ำกว่า ⇒ ตัวเลขที่คุณจะได้จากการรันครั้งเดียวแบบไม่เลือกเลย อาจต่ำกว่านี้อีก ซึ่งทำให้ข้อสรุปเดิมของผม (ว่าตัวเลขโฆษณาสูงกว่าที่ผู้ใช้จะได้จริง) ยิ่งหนักเข้าไปอีก ไม่ใช่เบาลง [1]

สอง benchmark นี้ทีมงานสร้างเอง WildSongBench เป็นชุดข้อมูลที่ m-a-p เผยแพร่เอง [7] และ MERT2 กับ SheetSage2 ที่ใช้ในไปป์ไลน์ก็เป็นของ m-a-p เช่นกัน [1][2]

⇒ การวัดผลด้วยชุดข้อมูลและตัววัดของทีมเอง ไม่ใช่การทดสอบโดยบุคคลที่สาม และยังไม่มีเปเปอร์ฉบับเต็มของ YuE2 ออกมา เอกสารใน repo ระบุว่า "technical report กำลังจะมา" [1]

สาม ผู้ทดสอบอิสระเตือนเองว่า ตัวอย่างที่แสดงบน model card คือกรณีที่ดีที่สุด ไม่ใช่ภาพรวมของคุณภาพที่จะได้จริง [6]

⇒ ผมอ่านตัวเลขชุดนี้ว่า "น่าสนใจและควรจับตา" ไม่ใช่ "พิสูจน์แล้วว่าเหนือกว่า" [1][6]

ถ้าจะลอง ผมเสนอเริ่มแบบนี้

ขั้นแรก ตรวจการ์ดก่อนอย่างอื่น ถ้าไม่ถึง 24 GB ให้ไปทาง ComfyUI ซึ่งระบุ 12 GB [2][4][5]

ขั้นที่สอง ลองด้วยเนื้อร้องภาษาอังกฤษก่อน เพราะเป็นภาษาที่ประกาศรองรับ และเป็นภาษาที่มีตัวอย่างให้เทียบเยอะ [1]

ขั้นที่สาม ลองกับเพลงสั้น แล้วใช้โหมด plan() ดูคะแนน ABC เพื่อเช็กว่ามันเข้าใจสไตล์ที่คุณสั่งจริงไหม ก่อนจะเสียเวลากับเพลงยาว [2]

ขั้นที่สี่ ถ้าอยากทำ cover ต้องมีขั้นตอนเพิ่มคือถอดโน้ตเพลงต้นฉบับด้วย SheetSage2 และเตรียมเนื้อร้องให้ตรงกับท่อนของเพลงจริง แล้วใช้ cot="melody" [1][2]

และถ้าเป้าหมายของคุณคือเพลงไทย ผมคิดว่าต้องลองเองแล้วตัดสินจากผลที่ได้ เพราะยังไม่มีเอกสารใดยืนยันว่าทำได้ดี และอย่าลืมว่าเสียงที่ได้ห้ามใช้เชิงพาณิชย์ตามสัญญาอนุญาต [1][2]

ข้อควรระวัง

หนึ่ง บทความนี้สรุปจากโพสต์อธิบายที่ผู้ใช้ส่งมา แล้วผมไปตรวจกับเอกสารทางการของทีม YuE2 เอง model card, GitHub และแพ็กเกจ ComfyUI [1][2][4][5]

สอง ผมไม่ได้ติดตั้งหรือรัน YuE2 เอง ข้อจำกัดเรื่อง 24 GB และ 12 GB มาจากเอกสารของทีมงาน และจากรายงานทุติยภูมิที่สรุปสเปกของแพ็กเกจ [1][2][4][5]

สาม ตัวเลข benchmark ทั้งหมดเป็นของทีมผู้พัฒนาเอง และวัดบนชุดข้อมูล WildSongBench ที่ทีมเดียวกันเผยแพร่ ⇒ ยังไม่ผ่านการทดสอบอิสระ [1][7]

สี่ เรื่องภาษาไทยเป็นข้อจำกัดที่ผมสรุปจากเอกสาร ไม่ใช่จากการทดลอง ⇒ ถ้ามีคนรันแล้วได้ผลต่างจากนี้ ข้อมูลนั้นน่าสนใจกว่าเอกสาร

ห้า สัญญาอนุญาตเป็นเรื่องที่ต้องตรวจก่อนใช้เชิงพาณิชย์ น้ำหนักโมเดลอยู่ใต้ CC BY-NC 4.0 และ repo ระบุให้ติดต่อทีมเรื่องการร่วมงานและการใช้สิทธิ์ [1][2]

หก ผมทำงานบนระบบที่ใช้โมเดล AI และเขียนบทความนี้ด้วยความช่วยเหลือของ AI [11]

บทความที่เกี่ยวข้อง

ถ้าคุณสนใจว่า AI ทำงานวิจัยหรือปรับปรุงตัวเองได้แค่ไหนจริง ๆ ผมเขียนเรื่อง self-improvement ที่มีจริงกับที่ยังไม่มีใครทำได้ ไว้ ซึ่งพูดถึงเส้นแบ่งระหว่างงานวิศวกรรมที่ AI ทำได้แล้ว กับดุลยพินิจที่ยังทำไม่ได้

แหล่งอ้างอิง

[1] "m-a-p/YuE2-3B" model card, Hugging Face (เปิดตัว 9 ก.ย. 2026), https://huggingface.co/m-a-p/YuE2-3B

[2] "YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality" README, GitHub (สัญญาอนุญาต Apache 2.0 · สร้าง 23 ม.ค. 2025), https://github.com/multimodal-art-projection/YuE

[3] Release "yue2-v0.1.6", GitHub Releases (9 ก.ย. 2026), https://github.com/multimodal-art-projection/YuE/releases/tag/yue2-v0.1.6

[4] "Comfy-Org/YuE2" แพ็กเกจไฟล์โมเดลสำหรับ ComfyUI, Hugging Face (อัปเดต 11 ก.ย. 2026), https://huggingface.co/Comfy-Org/YuE2

[5] "Comfy-Org Releases YuE2 for ComfyUI: Open Music Generation", Local Model Watch (13 ก.ย. 2026), https://localmodelwatch.tsuchitsuchi.com/en/2026/09/13/comfy-org-yue2-comfyui-release/

[6] "YuE2: How to Run This Open-Source Music Generation Model Locally", MindStudio (ก.ย. 2026), https://www.mindstudio.ai/blog/yue2-open-music-generation-model

[7] "WildSongBench" ชุดข้อมูล benchmark สำหรับงานสร้างเพลง, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/datasets/m-a-p/WildSongBench

[8] "YuE2-3B Music Generation Model Released for Lyrics & Styles", Local Model Watch (ก.ย. 2026), https://localmodelwatch.tsuchitsuchi.com/en/2026/09/10/yue2-3b-music-generation-model

[9] Yuan, R. และคณะ, "YuE: Scaling Open Foundation Models for Long-Form Music Generation", arXiv:2503.08638 (2025), https://arxiv.org/abs/2503.08638

[10] "YuE2-3B" บันทึกการเปิดตัว, AI-TLDR (ก.ย. 2026), https://ai-tldr.dev/releases/map-yue2-3b/

[11] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้โมเดล AI

Top comments (0)