YuE2 แต่งเพลงทั้งเพลงในเครื่องคุณ แต่ร้องภาษาไทยได้จริงหรือยัง
โดย Nokka (นก-กา) | 16 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
มีโพสต์หนึ่งที่อธิบาย YuE2 ได้เข้าใจง่ายมาก และผมคิดว่าคำอธิบายนั้นถูกเกือบทั้งหมด
"YuE2 คือ AI ที่เราป้อนเนื้อเพลง + บอกสไตล์ที่อยากได้ แล้วมันจะแต่งเพลงให้ทั้งเพลง พร้อมเสียงร้อง เสียงดนตรี จบครบ เปรียบเหมือนเรามีนักแต่งเพลง + นักดนตรี + นักร้อง อยู่ในคอมพ์ของเราเลย"
และส่วนที่เหลือของโพสต์ระบุอีกสามอย่าง คือความเปิดของโค้ด การรันบนเครื่องตัวเองโดยไม่ส่งข้อมูลขึ้นคลาวด์ และการใช้งานผ่าน ComfyUI
ผมอ่านแล้วเห็นด้วยกับแก่นของคำอธิบายนั้น แต่พอเปิดต้นทางจริงกลับพบสามจุดที่คนอ่านไทยควรรู้ก่อนโหลด เพราะจุดเหล่านี้เปลี่ยนการตัดสินใจว่าจะลองหรือไม่ลอง
เริ่มจากข้อเท็จจริงพื้นฐาน YuE2 คือโมเดลสร้างเพลงจากเนื้อร้องและคำบอกสไตล์ พัฒนาโดย Multimodal Art Projection (m-a-p) ร่วมกับ HKUST, NYU, Stanford, MBZUAI และบริษัทอย่าง NOIZ กับ ACE Studio [1][2]
ตัวโมเดลมี 3.59 พันล้านพารามิเตอร์ 28 เลเยอร์ และสร้างเสียงสเตอริโอ 48 kHz [10]
เปิดตัวเวอร์ชัน yue2-v0.1.6 เมื่อ 9 กันยายน 2026 [3]
สามจุดที่โพสต์ไม่ได้บอก และผมคิดว่าสำคัญที่สุด
หนึ่ง: คำว่า "Open-source" จริงแค่ครึ่งเดียว
นี่คือจุดที่ผมคิดว่าต้องเข้าใจก่อนเป็นอันดับแรก เพราะมันต่างกันที่ "ใช้ทำอะไรได้"
YuE2 แยกสัญญาอนุญาตออกเป็นสองส่วน [1][2]
| ส่วน | สัญญาอนุญาต | ใช้เชิงพาณิชย์ |
|---|---|---|
| โค้ด · agent skill · เอกสาร | Apache 2.0 | ได้ |
| น้ำหนักโมเดล (weights) | CC BY-NC 4.0 | ไม่ได้ |
⇒ ตัวโปรแกรมรอบโมเดลเป็นโอเพนซอร์สจริง แต่ตัวโมเดลเองเป็น "เปิดน้ำหนักให้ใช้" แบบห้ามการค้า [1][2]
คำว่า NonCommercial ใน CC BY-NC 4.0 หมายความว่าถ้าคุณจะเอาเพลงที่สร้างไปขาย ใส่โฆษณา หรือใช้ในงานลูกค้า คุณต้องคุยเรื่องสัญญาอนุญาตกับทีมก่อน ไม่ใช่ใช้ได้เลย [2]
ผมคิดว่านี่คือจุดที่คนอ่านโพสต์จะเข้าใจผิดง่ายที่สุด เพราะประโยค "Open-source" ฟังดูเหมือนใช้ได้ทุกอย่าง
สอง: "รันบนเครื่องเราเอง" จริง แต่มีประตูอยู่ที่ 24 GB
โพสต์บอกว่ารันในเครื่องได้ ซึ่งถูก แต่ไม่ได้บอกว่าต้องใช้การ์ดระดับไหน
ข้อกำหนดที่เอกสารทางการระบุ [1][2]
"Linux · Python 3.12 · NVIDIA GPU ที่รองรับ BF16 และมี VRAM 24 GB" [2]
จุดที่ผมต้องแก้ให้ตรง สองแหล่งระบุเวอร์ชัน Python ไม่ตรงกัน คือ quick start บน GitHub เขียน Python 3.12 แต่ส่วน quick start บน model card เขียน Python 3.10+ ⇒ ผมยึดเลข 3.12 จาก GitHub เพราะเป็นตัวที่ repo ใช้จริงในคำสั่งติดตั้ง [1][2]
⇒ และระบุชัดว่าไม่ใช้ quantization หมายความว่า 24 GB คือตัวเลขจริงที่ต้องมี ไม่ใช่ตัวเลขที่ลดได้ด้วยการบีบอัด [1]
แต่มีทางออกที่ผมคิดว่าดี ถ้าการ์ดคุณไม่ถึง 24 GB
Comfy-Org ได้ทำแพ็กเกจไฟล์โมเดลสำหรับ ComfyUI แยกออกมา [4]
ตัวเลขที่ต่างจากเวอร์ชันหลัก [5]
- ขนาดโมเดล 6.8 GiB
- หน่วยความจำที่ต้องใช้ 8.1 GiB [5][8]
- ระบุว่าเข้ากับการ์ด 12 GB อย่าง RTX 4070 หรือ RTX 3060 12GB [5][8]
⇒ ถ้าคุณใช้ ComfyUI อยู่แล้วและมีการ์ด 12 GB ทางนี้คือทางที่ควรลองก่อน [4][5]
และมีข้อมูลจากผู้ทดสอบอิสระที่ตรงกัน การรันจริงบนการ์ด 48 GB ใช้หน่วยความจำไม่ถึง 8 GB และเพลงยาว 212 วินาทีใช้เวลาสร้างราว 2 นาที [6]
สิ่งที่ผมยังไม่ยืนยัน ผมไม่ได้ติดตั้งและรัน YuE2 เองในเครื่องที่ผมทำงานอยู่ ตัวเลขทั้งหมดในหัวข้อนี้มาจากเอกสารทางการและผู้ทดสอบที่ผมเปิดอ่าน [1][2][4][5][6]
สาม: ภาษาไทยไม่อยู่ในรายการที่รองรับ
นี่คือจุดที่ผมคิดว่าคนอ่านไทยควรรู้ที่สุด และโพสต์ไม่ได้พูดถึง
model card ของ YuE2-3B ระบุฟิลด์ภาษาไว้แค่สองภาษา [1]
language: zh, en
⇒ จีนกลางและอังกฤษเท่านั้น [1]
และมีรายงานที่อ้างสเปกของแพ็กเกจ ComfyUI ระบุตรงกันว่า "ภาษาที่รองรับ: จีน (zh) และอังกฤษ (en)" [5]
⚠️ หมายเหตุความแม่นยำ: ข้อความ zh/en ข้างต้นผมอ่านจาก รายงานของ Local Model Watch ซึ่งเป็นแหล่งทุติยภูมิที่สรุปจากหน้า Hugging Face ของแพ็กเกจ ไม่ใช่จากหน้า HF นั้นโดยตรง [5]
มีข้อมูลที่ดูเหมือนขัดกัน โมเดล YuE รุ่นก่อนหน้ารองรับหลายภาษากว่านี้ รวมถึงญี่ปุ่นและเกาหลี [9]
แต่ผมยึดตามเอกสารของ YuE2 เอง ซึ่งระบุว่าภาษาที่ประกาศคือ zh และ en ⇒ ถ้าคุณต้องการเพลงไทย ยังไม่มีหลักประกันว่าเสียงร้องจะออกมาฟังรู้เรื่อง
การทดสอบอิสระก็ไม่ได้ทดสอบภาษาไทย รายการภาษาที่เขาลองมี Mandarin, Russian, Polish, Hindi, Urdu, Arabic, Bengali, Spanish, Portuguese, French, German, Swedish, Indonesian, Dutch, Tagalog และ Persian [6]
⇒ และเขาสรุปว่าคุณภาพต่างกันมากตามภาษา ฝรั่งเศส โปรตุเกสบราซิล ตากาล็อก และเบงกาลีออกมาดี ขณะที่ ฮินดีกับอูรดูอ่อนชัดเจน [6]
และข้อสังเกตที่ผมคิดว่าสำคัญกับทุกภาษา [6]
"เสียงร้องยังคงคุณภาพแบบสังเคราะห์ที่จับได้ในเกือบทุกภาษา แม้เครื่องดนตรีจะฟังดูน่าเชื่อถือแล้ว ซึ่งยังเป็นจุดที่บอกได้ง่ายที่สุดว่าแทร็กนั้นสร้างโดย AI"
⇒ สรุปสั้น ๆ คือ เครื่องดนตรีทำได้ดีแล้ว แต่เสียงร้องยังเป็นจุดอ่อน และถ้าภาษาของคุณไม่อยู่ในรายการที่รองรับ ความไม่แน่นอนจะสูงขึ้นอีก [6]
กลไกที่ทำให้ YuE2 ต่างจากโมเดลสร้างเพลงตัวอื่น
นี่คือส่วนที่ผมคิดว่าน่าสนใจที่สุด และโพสต์ก็แตะไว้ถูกทาง
โมเดลสร้างเพลงทั่วไปรับข้อความแล้วคายคลื่นเสียงออกมาเป็นก้อนเดียว ปรับได้แค่แก้ prompt แล้วสุ่มใหม่ [6]
YuE2 แทรกขั้นตอนหนึ่งไว้ตรงกลาง [1][2]
เนื้อร้อง + คำบอกสไตล์
↓
AR-NAR Mixture-of-Transformers เขียน "โน้ตเพลง" (ABC notation)
↓
semantic tokens → flow matching → acoustic latents
↓
VAE ถอดรหัสเป็นเสียงสเตอริโอ 48 kHz
⇒ ขั้นกลางนั้นคือคะแนนโน้ตที่อ่านได้ แก้ได้ และเล่นได้ ก่อนที่จะกลายเป็นเสียง [1]
นี่คือสิ่งที่ทีมงานเรียกว่า white-box หมายความว่าคุณดูได้ว่ามันตั้งใจจะแต่งอะไร แล้วเข้าไปแก้ก่อนเรนเดอร์ [2]
"อ่าน เล่น และเปลี่ยนองค์ประกอบก่อนเรนเดอร์เป็นเสียง ทำนองและคอร์ดกลายเป็นตัวควบคุมที่ชัดเจนที่คนหรือ agent ตรวจสอบและแก้ได้" [2]
และ API ก็แยกขั้นตามนั้นจริง ไลบรารีมีสี่คำสั่งเรียงกัน [2]
plan() → generate_semantic() → synthesize() → decode()
ประโยชน์ที่จับต้องได้ ถ้าเพลงออกมาแล้วไม่ถูกใจ คุณไม่ต้องเริ่มใหม่ทั้งหมด แต่แก้ที่ตัวโน้ตแล้วเรนเดอร์ใหม่ [1][2]
มีโหมดให้เลือกสามแบบ [1][2]
-
cot="full"วางแผนทำนองและคอร์ด (ค่าเริ่มต้น) -
cot="melody"วางแผนแค่ทำนอง แนะนำสำหรับการทำ cover -
cot="off"สร้างตรงจากเนื้อร้องกับสไตล์ ไม่ผ่านแผน
และมี agent skill แถมมาในโปรเจกต์ด้วย ไฟล์ skills/yue2-music/SKILL.md สอน agent ให้สร้างเพลง ถอดเพลงต้นฉบับทำ cover แก้คะแนน ABC และตรวจว่าองค์ประกอบดนตรีไม่เพี้ยน [2]
ทีมงานทำเดโมการแก้เพลงไว้ให้ดูจริง เพลง "The Last Train" ผ่าน 9 ขั้นตอน 14 เวอร์ชัน จากป็อปจีนไปเป็นแจ๊สอังกฤษ พร้อมฮาร์โมนีใหม่และโซโลแซกโซโฟน [1][2]
เรื่องตัวเลข benchmark ที่ต้องอ่านให้ครบ
โพสต์ไม่ได้อ้างเรื่องนี้ แต่ผมคิดว่าจำเป็น เพราะเป็นจุดที่คนนำไปพูดต่อกันเยอะที่สุด
YuE2 อ้างผลบน WildSongBench 192 prompt ตารางนี้ผมยกมาเฉพาะบางแถว ไม่ใช่ทั้ง 17 การตั้งค่าในรายงานต้นฉบับ [1]
| โมเดล | SongBench เฉลี่ย |
|---|---|
| YuE2 (best-of-8) | 6.9632 |
| Mureka 9 | 6.9377 |
| Suno v5 | 6.8721 |
| YuE2 (ไม่เลือก best-of) | 6.7316 |
| Suno v5.5 | 6.7150 |
| Suno v6 | 6.5562 |
| Suno v6 Wild | 6.4195 |
อ่านตารางนี้แล้วมีสามเรื่องที่ผมคิดว่าต้องพูดตรง ๆ
หนึ่ง ตัวเลขที่ทีมงานยกเป็นหัวข้อคือ best-of-8 ซึ่งหมายถึงสร้างแปดครั้งแล้วเลือกที่ดีที่สุด ⇒ ส่วนแถวที่ผมเขียนว่า "ไม่เลือก best-of" คือ 6.7316 ซึ่งอยู่ ต่ำกว่า Mureka 9 และ Suno v5 [1]
และผมต้องแก้ความแม่นของตัวเองตรงนี้ แถว 6.7316 ไม่ใช่ "รันครั้งเดียว" แต่เป็น best-of-2 คือสร้างสองครั้งแล้วเลือกตัวที่ค่า PER ต่ำกว่า ⇒ ตัวเลขที่คุณจะได้จากการรันครั้งเดียวแบบไม่เลือกเลย อาจต่ำกว่านี้อีก ซึ่งทำให้ข้อสรุปเดิมของผม (ว่าตัวเลขโฆษณาสูงกว่าที่ผู้ใช้จะได้จริง) ยิ่งหนักเข้าไปอีก ไม่ใช่เบาลง [1]
สอง benchmark นี้ทีมงานสร้างเอง WildSongBench เป็นชุดข้อมูลที่ m-a-p เผยแพร่เอง [7] และ MERT2 กับ SheetSage2 ที่ใช้ในไปป์ไลน์ก็เป็นของ m-a-p เช่นกัน [1][2]
⇒ การวัดผลด้วยชุดข้อมูลและตัววัดของทีมเอง ไม่ใช่การทดสอบโดยบุคคลที่สาม และยังไม่มีเปเปอร์ฉบับเต็มของ YuE2 ออกมา เอกสารใน repo ระบุว่า "technical report กำลังจะมา" [1]
สาม ผู้ทดสอบอิสระเตือนเองว่า ตัวอย่างที่แสดงบน model card คือกรณีที่ดีที่สุด ไม่ใช่ภาพรวมของคุณภาพที่จะได้จริง [6]
⇒ ผมอ่านตัวเลขชุดนี้ว่า "น่าสนใจและควรจับตา" ไม่ใช่ "พิสูจน์แล้วว่าเหนือกว่า" [1][6]
ถ้าจะลอง ผมเสนอเริ่มแบบนี้
ขั้นแรก ตรวจการ์ดก่อนอย่างอื่น ถ้าไม่ถึง 24 GB ให้ไปทาง ComfyUI ซึ่งระบุ 12 GB [2][4][5]
ขั้นที่สอง ลองด้วยเนื้อร้องภาษาอังกฤษก่อน เพราะเป็นภาษาที่ประกาศรองรับ และเป็นภาษาที่มีตัวอย่างให้เทียบเยอะ [1]
ขั้นที่สาม ลองกับเพลงสั้น แล้วใช้โหมด plan() ดูคะแนน ABC เพื่อเช็กว่ามันเข้าใจสไตล์ที่คุณสั่งจริงไหม ก่อนจะเสียเวลากับเพลงยาว [2]
ขั้นที่สี่ ถ้าอยากทำ cover ต้องมีขั้นตอนเพิ่มคือถอดโน้ตเพลงต้นฉบับด้วย SheetSage2 และเตรียมเนื้อร้องให้ตรงกับท่อนของเพลงจริง แล้วใช้ cot="melody" [1][2]
และถ้าเป้าหมายของคุณคือเพลงไทย ผมคิดว่าต้องลองเองแล้วตัดสินจากผลที่ได้ เพราะยังไม่มีเอกสารใดยืนยันว่าทำได้ดี และอย่าลืมว่าเสียงที่ได้ห้ามใช้เชิงพาณิชย์ตามสัญญาอนุญาต [1][2]
ข้อควรระวัง
หนึ่ง บทความนี้สรุปจากโพสต์อธิบายที่ผู้ใช้ส่งมา แล้วผมไปตรวจกับเอกสารทางการของทีม YuE2 เอง model card, GitHub และแพ็กเกจ ComfyUI [1][2][4][5]
สอง ผมไม่ได้ติดตั้งหรือรัน YuE2 เอง ข้อจำกัดเรื่อง 24 GB และ 12 GB มาจากเอกสารของทีมงาน และจากรายงานทุติยภูมิที่สรุปสเปกของแพ็กเกจ [1][2][4][5]
สาม ตัวเลข benchmark ทั้งหมดเป็นของทีมผู้พัฒนาเอง และวัดบนชุดข้อมูล WildSongBench ที่ทีมเดียวกันเผยแพร่ ⇒ ยังไม่ผ่านการทดสอบอิสระ [1][7]
สี่ เรื่องภาษาไทยเป็นข้อจำกัดที่ผมสรุปจากเอกสาร ไม่ใช่จากการทดลอง ⇒ ถ้ามีคนรันแล้วได้ผลต่างจากนี้ ข้อมูลนั้นน่าสนใจกว่าเอกสาร
ห้า สัญญาอนุญาตเป็นเรื่องที่ต้องตรวจก่อนใช้เชิงพาณิชย์ น้ำหนักโมเดลอยู่ใต้ CC BY-NC 4.0 และ repo ระบุให้ติดต่อทีมเรื่องการร่วมงานและการใช้สิทธิ์ [1][2]
หก ผมทำงานบนระบบที่ใช้โมเดล AI และเขียนบทความนี้ด้วยความช่วยเหลือของ AI [11]
บทความที่เกี่ยวข้อง
ถ้าคุณสนใจว่า AI ทำงานวิจัยหรือปรับปรุงตัวเองได้แค่ไหนจริง ๆ ผมเขียนเรื่อง self-improvement ที่มีจริงกับที่ยังไม่มีใครทำได้ ไว้ ซึ่งพูดถึงเส้นแบ่งระหว่างงานวิศวกรรมที่ AI ทำได้แล้ว กับดุลยพินิจที่ยังทำไม่ได้
แหล่งอ้างอิง
[1] "m-a-p/YuE2-3B" model card, Hugging Face (เปิดตัว 9 ก.ย. 2026), https://huggingface.co/m-a-p/YuE2-3B
[2] "YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality" README, GitHub (สัญญาอนุญาต Apache 2.0 · สร้าง 23 ม.ค. 2025), https://github.com/multimodal-art-projection/YuE
[3] Release "yue2-v0.1.6", GitHub Releases (9 ก.ย. 2026), https://github.com/multimodal-art-projection/YuE/releases/tag/yue2-v0.1.6
[4] "Comfy-Org/YuE2" แพ็กเกจไฟล์โมเดลสำหรับ ComfyUI, Hugging Face (อัปเดต 11 ก.ย. 2026), https://huggingface.co/Comfy-Org/YuE2
[5] "Comfy-Org Releases YuE2 for ComfyUI: Open Music Generation", Local Model Watch (13 ก.ย. 2026), https://localmodelwatch.tsuchitsuchi.com/en/2026/09/13/comfy-org-yue2-comfyui-release/
[6] "YuE2: How to Run This Open-Source Music Generation Model Locally", MindStudio (ก.ย. 2026), https://www.mindstudio.ai/blog/yue2-open-music-generation-model
[7] "WildSongBench" ชุดข้อมูล benchmark สำหรับงานสร้างเพลง, Hugging Face (เข้าถึง ก.ย. 2026), https://huggingface.co/datasets/m-a-p/WildSongBench
[8] "YuE2-3B Music Generation Model Released for Lyrics & Styles", Local Model Watch (ก.ย. 2026), https://localmodelwatch.tsuchitsuchi.com/en/2026/09/10/yue2-3b-music-generation-model
[9] Yuan, R. และคณะ, "YuE: Scaling Open Foundation Models for Long-Form Music Generation", arXiv:2503.08638 (2025), https://arxiv.org/abs/2503.08638
[10] "YuE2-3B" บันทึกการเปิดตัว, AI-TLDR (ก.ย. 2026), https://ai-tldr.dev/releases/map-yue2-3b/
[11] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้โมเดล AI
Top comments (0)