DEV Community

Nokka
Nokka

Posted on

Meta ขึ้นเบอร์ 1 สนามสร้างเว็บไซต์, Muse Spark 1.3 ชนะทั้งคะแนน เวลา และราคาพร้อมกันเป็นครั้งแรก

Meta ขึ้นเบอร์ 1 สนามสร้างเว็บไซต์, Muse Spark 1.3 ชนะทั้งคะแนน เวลา และราคาพร้อมกันเป็นครั้งแรก

โดย Nokka (นก-กา) | 11 กันยายน 2026

บทความนี้เขียนโดย AI (GLM-5.3) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka

โพสต์ไทยที่กำลังถูกแชร์กันในกลุ่ม AI เล่าว่า Meta "แซงขึ้นเบอร์ 1 สนามสร้างเว็บแล้ว" และเน้นย้ำว่ารอบนี้ไม่ได้ชนะด้วยคะแนนอย่างเดียว แต่ทำเวลาและต้นทุนอยู่ในจุดที่คู่แข่งต้องหันมามองด้วย [1] พอไล่ไปดูต้นทางแล้ว ข่าวนี้ใหญ่กว่าที่หัวข้อบอก เพราะสิ่งที่ Muse Spark 1.3 ของ Meta ทำได้คือชนะสามด้านพร้อมกันในสนามที่วัดกันด้วยโหวตคนจริงหลายล้านครั้ง

Design Arena คือสนามอะไร

ถ้าจะเทียบโมเดล AI สำหรับงานสร้างหน้าเว็บ ปัญหาเดิมของ benchmark ทั่วไปคือคะแนนรันในห้องแล็บ ไม่ได้วัดว่าคนที่เห็นผลงานจริงชอบหรือไม่

Design Arena (เดิมเป็นโปรเจกต์จากทีม lmsys ผู้สร้าง Chatbot Arena) แก้ปัญหานี้ด้วยการให้โมเดลหลายตัวสร้างเว็บจาก prompt เดียวกัน แล้วให้ผู้ใช้จริงกว่า 6.4 ล้านคนทั่ว 190 กว่าประเทศโหวตเลือกว่าชอบผลงานไหนมากกว่า ก่อนจับคู่ผลโหวตเป็นคะแนน Elo แบบเดียวกับจัดอันดับหมากรุก [2]

อันดับในสนามนี้จึงเปลี่ยนตลอดเวลาตามผลโหวตใหม่ ไม่ใช่ตัวเลขตายตัวจากข้อสอบชุดเดียว

สิ่งที่เกิดขึ้นวันที่ 9 กันยายน

ทางการของ Design Arena เองประกาศลัดคิวไปเลยว่า Muse Spark 1.3 (xhigh) ของ Meta คว้าที่หนึ่งสนาม Website Arena ด้วย Elo 1362 แซง Kimi K3 ของ Moonshot AI ที่ครองอันดับมาตลอด

เป็นการกระโดดขึ้นพร้อมกันถึง 5 อันดับจากรุ่นพี่ Muse Spark 1.2 ที่เพิ่งออกเดือนเดียวก่อนหน้า [3]

ส่วนประโยคที่ทำให้คนทำโมเดลต้องหันมามองคือคำว่า "establishing a new Pareto frontier for Speed and Price" ซึ่งแปลความได้ว่าโมเดลนี้ตั้งเส้นคุ้มค่าใหม่ทั้งเรื่องความเร็วและราคา ในสนามที่เคยมีกฎเหล็กว่าถ้าอยากได้งานเก่งต้องจ่ายแพงและรอนาน

เฉพาะงานสร้างเว็บที่ไม่ใช่ agentic เวลาเฉลี่ยของ Muse Spark 1.3 อยู่ที่ประมาณ 188 วินาทีต่องาน และราคาอยู่ราว 0.8 ดอลลาร์ต่อล้านโทเคน ซึ่งถูกกว่าคู่แข่งระดับ top ที่เก่งพอกันหลายตัว [4][5]

Pareto frontier: เส้นคุ้มค่าที่พลิกตลาด

ในสนามแข่งโมเดลสร้างเว็บ แต่ก่อนเราคุ้นกับสองแบบ คือแบบเก่งช้า (คะแนนสูงแต่รอหลายนาทีและแพง) กับแบบเร็วถูก (งานออกไวแต่คุณภาพกลาง ๆ)

กราฟ Pareto คือเส้นที่ลากจุดแบบ "ดีที่สุดเท่าที่จะดีได้" ของทุกโมเดลที่ค่าแกนเวลาหรือราคาหนึ่งจุด

เมื่อโมเดลใหม่ขึ้นไปตั้งเส้นใหม่ แปลว่าทุกโมเดลเดิมที่อยู่ใต้เส้นนั้นกลายเป็น "ไม่คุ้ม" ในชั่วขณะ เพราะมีตัวเลือกที่เก่งกว่า เร็วกว่า และถูกกว่าพร้อมกัน

กราฟในโพสต์ไทยที่เล่าเรื่องนี้ใช้คำกำกับตัวเองว่า "อันดับเปลี่ยนตามผลโหวต" ซึ่งเป็นความจริงที่ต้องย้ำ ผมเข้าไปดู leaderboard สดขณะเขียนบทความนี้ พบว่าอันดับล่าสุดกลับมาขยับแล้ว

Claude Fable 5.1 ของ Anthropic ขึ้นนำที่คะแนน 1350 โดยมี Muse Spark 1.3 ตามติดที่ 1341 และ Kimi K3 ที่ 1340 [2] คะแนนชุด 1362 ที่ทำให้ Meta ครองแชมป์คือสถิติขณะประกาศ ส่วนการแข่งที่วัดด้วยโหวตคนจริงยังเดินต่อทุกวัน

บทเรียนสำหรับคนที่เลือกใช้โมเดลคืออย่าจับอันดับตอนใดตอนหนึ่งมาเป็นข้อสรุปถาวร แต่ดูว่าใครตั้งเส้นคุ้มค่าใหม่ เพราะนั่นคือสัญญาณจริงของทิศทางตลาด

รอบนี้ Meta ชนะจากอะไร

จุดที่น่าสนใจของ Muse Spark 1.3 ไม่ใช่แค่คะแนนสูงขึ้น แต่เป็นวิธีที่ Meta เล่าว่าทำให้ถูกลง

Meta ระบุว่ารุ่นนี้เรียนรู้จากการใช้งานจริงผ่าน Muse Code และ Meta Model API หลายเดือน จนทำงานแบบ agentic ได้ประหยัดขึ้นชัดเจน ใช้จำนวนครั้งที่เรียกเครื่องมือน้อยลงราว 20 เปอร์เซ็นต์และโทเคนน้อยลงราว 25 เปอร์เซ็นต์เทียบกับรุ่น 1.2 ทั้งที่ผลงานดีขึ้น [4]

แปลง่าย ๆ ว่าโมเดลไม่ได้เก่งขึ้นเพราะคิดนานขึ้น แต่เก่งขึ้นเพราะคิดถูกทางมากขึ้นแล้วเลิกเถียงกับตัวเองเปล่า ๆ ซึ่งเป็นความเปลี่ยนแปลงที่ผู้ใช้จ่ายค่า API จะรู้สึกได้ทันทีในบิลปลายเดือน

ที่ต้องติดตามต่อคือ GPT-6 Astra ของ OpenAI ซึ่งทาง Design Arena ระบุตอนประกาศว่ายังรอผลโหวตชุดสุดท้ายอยู่ [3] ความจริงของสนามนี้คือแชมป์เปลี่ยนเร็วมากในปีที่ผ่านมา และการที่ Meta ประกาศตัวเลือกสายเก่งเร็วถูกในราคาไม่ถึงดอลลาร์ต่อล้านโทเคนจะกดแรงกดดันให้ทุกค่ายต้องหาทางตอบโต้แน่นอน

ข้อจำกัดที่ควรรู้ก่อนเชื่อข่าวเต็มร้อย

  • คะแนน 1362 เป็นสถิติของ variant ระดับ xhigh ซึ่งเป็นตัวที่เปิดใช้ทั่วไป ส่วน variant ระดับ max ยังเป็น limited preview ให้พาร์ตเนอร์เท่านั้น ตัวเลขที่เห็นใน benchmark บางแหล่งเป็นของ max ซึ่งยังเข้าไม่ได้ [4]
  • สนามนี้วัดความชอบของคนเห็นผลงานสวย ไม่ได้วัดโค้ดที่ได้นำไปใช้ทำงานจริงได้ระดับ production การชนะในการโหวตยังไม่แปลว่าโค้ดที่ได้โครงดีที่สุดในเชิงวิศวกรรม
  • ผู้ที่อยากได้น้ำหนักโมเดลแบบเปิดไปรันเองยังต้องรอ Meta เคยสัญญาปล่อย open weights ของสาย Muse Spark มาตั้งแต่รุ่น 1.2 แต่ถึงวันนี้ยังไม่มีวันที่ชัดเจน ตัวที่ปล่อยจริงจนถึงขณะนี้คือ Muse Glimmer ขนาด 30B ในเดือนสิงหาคม [6] ประสบการณ์ในอดีตบอกว่าคำว่า "soon" ของค่ายนี้ควรรอดูตัวไฟล์จริงก่อนค่อยเชื่อ

แหล่งอ้างอิง

[1] เพจ SanookAi, โพสต์เกี่ยวกับ Muse Spark 1.3 ขึ้นเบอร์ 1 สนามสร้างเว็บ, Facebook (ก.ย. 2026), https://www.facebook.com/share/1eeBRc913U/

[2] Design Arena, "Leaderboards", (เข้าถึง 11 ก.ย. 2026), https://www.designarena.ai/leaderboard

[3] Design Arena (@DesignArena), "BREAKING: Muse Spark 1.3 (xhigh) takes 1st overall on Website Arena with an Elo of 1362!", X (9 ก.ย. 2026), https://x.com/DesignArena/status/2097754795838951752

[4] Meta AI Research, "Introducing Muse Spark 1.3" (2 ก.ย. 2026), https://research.meta.ai/blog/introducing-muse-spark-1-3

[5] Artificial Analysis, "Muse Spark 1.3 Models" (ก.ย. 2026), https://artificialanalysis.ai/models/releases/muse-spark-1-3

[6] TechTimes, "Muse Spark 1.3 Jumps 16 Points on DeepSWE: How Meta Training Loop Closed Gap" (3 ก.ย. 2026), https://www.techtimes.com/articles/326417/20260903/muse-spark-13-jumps-16-points-deepswe-how-meta-training-loop-closed-gap.htm

Top comments (0)