DEV Community

Cover image for Bonsai 2 27B โมเดล Qwen ระดับ 27B ในไฟล์ 5.9GB ทำได้จริงแค่ไหน
Nokka
Nokka

Posted on AI-assisted

Bonsai 2 27B โมเดล Qwen ระดับ 27B ในไฟล์ 5.9GB ทำได้จริงแค่ไหน

โดย Nokka (นก-กา) | 22 กันยายน 2569

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka


ข่าวจาก Prism ML สัปดาห์นี้คือ Ternary Bonsai 2 27B โมเดลที่บีบ Qwen3.8 ขนาด 27B จนเหลือไฟล์ราว 5.9GB พร้อมโฆษณาว่าคงความสามารถไว้ 98.2% ของต้นแบบเต็มความละเอียด ใครใช้เครื่องที่แรมไม่มากก็เริ่มหวังว่าจะรันโมเดลระดับนี้ได้ในเครื่องจริง ๆ

แต่ตัวเลข 98.2% นี้มีเรื่องเล่าเบื้องหลังมากกว่าที่โฆษณา เราจึงรวมทั้งประกาศของผู้ทำและบทวิเคราะห์อิสระที่ไล่อ่านงานวิจัยจริงมาเล่าให้ครบทั้งสองฝั่ง ให้คุณตัดสินเองว่าควรโหลดมาลองหรือรอต่อ

ภาพประกอบ: Bonsai 2 27B เทียบ Qwen3.8 เต็ม

ฝั่งที่หนึ่ง: ผลจากผู้ทำ ตัวเลขน่าประทับใจจริง

จุดเริ่มของ Bonsai 2 คือเทคนิคการบีบน้ำหนักแบบ ternary คือให้ค่าน้ำหนักเหลือแค่สามสถานะ (ลบหนึ่ง ศูนย์ บวกหนึ่ง) คูณด้วยสัดส่วนกลุ่มละ 128 ค่า ทำให้ได้ความหนาแน่นเฉลี่ย 1.76 บิตต่อน้ำหนักหนึ่งค่า ไฟล์ทั้งโมเดลจึงเหลือ 5.9GB จากต้นแบบที่ใหญ่กว่าเก้าเท่าตัว [1]

ตัวเลขเชิงความสามารถที่ผู้ทำรายงาน: คะแนนรวมทุกด้าน 83.9 เทียบกับ 85.4 ของต้นแบบเต็ม (คงไว้ 98.2%) (หมายเหตุ: ตัวเลขในชุดประกาศนี้วัดจากชุด benchmark ของ Prism ML ซึ่งต่างจากตารางในหน้าโมเดล Hugging Face ที่ใช้ชุดวัดอีกแบบ [3] ผลไปทางเดียวกันแต่ตัวเลขไม่เท่ากันเป๊ะ) โดยรายด้านน่าสนใจว่า งานคณิตศาสตร์เกือบไม่หายไปเลย (96.57 เทียบ 97.06) ตามด้วยการเขียนโค้ด 81.58 เทียบ 82.17 และการเรียนตามคำสั่งกลับดีกว่าต้นแบบด้วยซ้ำ (82.66 เทียบ 81.25) ส่วนที่หายมากสุดคือด้านการมองภาพ (78.59 เทียบ 81.64) [1]

ข้อกำหนดใช้งานที่คนสนใจจะอยากรู้: รองรับบริบทยาว 262K โทเคน รับข้อความและภาพ และเป็นสัญญาอนุญาต Apache 2.0 ใช้เชิงพาณิชย์ได้ [1]

ฝั่งที่สอง: บทวิเคราะห์อิสระชี้จุดที่โฆษณาไม่บอก

Kaitchup ซึ่งเคยทดสอบ Bonsai รุ่นแรกมาก่อน ออกบทวิเคราะห์สัปดาห์เดียวกัน มีสามข้อสังเกตที่ควรรู้ก่อนตัดสินใจ [2]

ตัวเลข 98.2% เป็นค่าเฉลี่ย ไม่ใช่การรับประกันทุกด้าน

ค่านี้คิดจากอัตราส่วนของคะแนนเฉลี่ยรวม ไม่ใช่สัญญาว่าทุกงานเหลือเท่าเดิม งานที่มักพังก่อนเวลาอันควรเมื่อโมเดลถูกบีบคืองานยาวหลายขั้นตอนอย่าง coding agent ที่ความผิดพลาดเล็ก ๆ สะสมกันเป็นความพังใหญ่ [2]

ผล agentic coding รายงานแยกนอกตารางหลัก

น่าสนใจว่าทีมผู้ทำทดสอบงาน agentic coding จริง แต่ไม่ได้ใส่ตัวเลขไว้ในตารางหลักที่ทุกคนเห็น ทำให้ค่า 98.2% ดูเกินจริงสำหรับงานกลุ่มนี้โดยเฉพาะ ทั้งที่การทำงานแบบ agent ยาว ๆ คือจุดที่โมเดลที่ถูกบีบต่างจากต้นแบบชัดที่สุด [2]

วิธีวัดมีข้อจำกัดที่ควรรู้

การทดสอบความแม่นทั้งหมดวัดจากโมเดลคลายแพ็กผ่าน vLLM บนการ์ด H100 ไม่ใช่การวัดจากไฟล์ GGUF บีบจริงที่วิ่งบนเครื่องผู้ใช้ และตั้งลิมิตคำตอบไว้แค่ 82K โทเคน ซึ่งเทียบกับโหมดคิดยาวแล้วถือว่าต่ำ ผู้วิเคราะห์จึงเตือนว่าผลที่เห็นเป็นการวัดความแม่นของโมเดล ไม่ใช่ประสบการณ์จริงบนสแตกที่บีบแล้ว [2]

มีข้อจำกัดเชิงปฏิบัติอีกจุด: Bonsai 2 ต้องใช้ runtime ของ Prism ML เอง เพราะมีการแปลงค่า activation คู่กับน้ำหนักที่ llama.cpp ปกติยังไม่รองรับ [2] ไฟล์โมเดลทั้งสองฟอร์แมต (PTQ1_0 ที่ 5.9GB และ PQ2_0 ที่ 7.2GB) ดาวน์โหลดได้จาก Hugging Face [3]

ความเร็วที่วัดจริง: การบีบคือสิ่งที่ทำให้เร็วตั้งแต่แรก

คำถามที่ทุกคนถามต่อจาก "เล็กจริงไหม" คือ "แล้วเร็วแค่ไหน" คำตอบจากตารางวัดจริงในหน้าโมเดลทางการ (วัดด้วย llama-bench ที่ batch size 1) อ่านออกมาได้สามข้อสำคัญ [3]

ยิ่งบีบยิ่งเร็ว เพราะคอขวดคือแบนด์วิดท์หน่วยความจำ

การสร้างคำ (decode) เป็นงานที่ต้องอ่านน้ำหนักทั้งโมเดลทุกโทเคน ตัวเลขจริงจากเครื่องทดสอบ: โน้ตบุ๊ก Apple M5 Pro สตรีมน้ำหนักอยู่ที่ราว 204 GB ต่อวินาที [3] คิดง่าย ๆ คือ

  • Bonsai 2 ขนาด 5.9GB ผ่านได้ราว 34-35 โทเคน/วินาทีในทางทฤษฎี วัดได้จริง 28.1 โทเคน/วินาที
  • ต้นแบบ FP16 ขนาด 54GB ถ้ารันได้จะเหลือราว 3.8 โทเคน/วินาทีเท่านั้น แต่ของจริงคือใส่ไม่พอตั้งแต่แรก

แปลว่าไฟล์ที่เล็กลง 9.3 เท่าไม่ได้แลกกับความเร็ว แต่กลับกัน ไฟล์เล็กคือสิ่งที่ทำให้เร็วขึ้นราว 9 เท่าบนฮาร์ดแวร์เดียวกัน เพราะต้องอ่านข้อมูลน้อยกว่าในการผลิตทุกโทเคน

การ์ดเกมราคาสองหมื่นบาทชนะการ์ดดาต้าเซ็นเตอร์หลักแสน

ตัวเลขที่ทำให้หลายคนต้องอ่านซ้ำ: RTX 5090 การ์ดสำหรับเครื่องเกมทั่วไปสร้างคำได้ 129.9 โทเคน/วินาที ชนะ H100 การ์ดดาต้าเซ็นเตอร์ที่ได้แค่ 113.9 ขณะที่ A100 รุ่นเก่ากว่าได้เพียง 73.9 ซึ่งตามหลังการ์ด RTX 4090 สำหรับผู้ใช้ทั่วไปด้วยซ้ำ เหตุผลคือที่ batch size 1 งานนี้ขับเคลื่อนด้วยแบนด์วิดท์หน่วยความจำซึ่งการ์ดระดับผู้บริโภครุ่นใหม่มีมากพอแล้ว ใครรันเพื่อใช้คนเดียวแล้วไปเช่า GPU ดาต้าเซ็นเตอร์คือเผาเงินเปล่าสำหรับงานนี้

จุดที่ต้องระวังบนโน้ตบุ๊ก: อ่านบริบทยาวคืออีกเรื่อง

การสร้างคำ 28.1 โทเคน/วินาทีบน M5 Pro ถือว่าลื่นพอคุยสนทนาได้สบาย แต่การกลืนบริบทตั้งต้น (prompt processing) บนเครื่องเดียวกันได้เพียง 387 โทเคน/วินาที หารด้วยบริบทสูงสุด 262K โทเคนเต็ม ๆ หมายถึงต้องรอราวสิบเอ็ดนาทีก่อนเริ่มตอบได้ ขณะที่ RTX 5090 ทำเรื่องเดียวกันจบในราวหนึ่งนาที

ดังนั้นคำโฆษณา "บริบท 262K บนโน้ตบุ๊ก" จริงแต่ต้องอ่านต่อให้จบ: ใช้ได้สบายกับการคุยที่บริบทสะสมค่อย ๆ โต แต่ถ้าจะอัดเอกสารยาวระดับแสนโทเคนเข้าไปทีเดียวแล้วถาม เตรียมใจรอ อีกจุดที่ควรรู้คือโมเดลนี้คิดก่อนตอบเป็นค่าเริ่มต้น (โหมด xhigh) การคิดยาวพันโทเคนบนเครื่องโน้ตบุ๊กคือรอเกือบสี่สิบวินาทีก่อนเห็นคำตอบแรก เอกสารแนะนำให้ลดเป็นโหมด medium เพื่อสมดุล

ตัวเลขสนุกอีกอัน: โมเดลนี้ถูกดาวน์โหลดไปแล้วกว่า 2.5 ล้านครั้งภายในห้าวันแรกบน Hugging Face [3] และไฟล์สองฟอร์แมตไม่ได้ตัวไหนเร็วกว่ากันเสมอ ไฟล์ PTQ1_0 ตัวเล็กชนะบนการ์ดรุ่นก่อน ส่วน PQ2_0 ตัวใหญ่กว่าชนะบนการ์ดรุ่นใหม่เพราะแกะบิตเร็วกว่า [3]

บทสรุปจากสองฝั่ง: ใช้ได้ แต่รู้ว่ากำลังได้อะไร

คำสรุปของผู้วิเคราะห์เอง ซึ่งเราเห็นด้วยคือ "Bonsai 2 27B น่าจะเป็นโมเดลที่ดีที่สุดที่รันได้ในหกกิกะไบต์" ข้อวิจารณ์ทั้งหมดมุ่งไปที่วิธีสื่อสารผลมากกว่าตัวโมเดล [2]

ผมมองว่าสำหรับคนใช้เครื่องแรมจำกัด Bonsai 2 เปิดทางที่เมื่อเดือนก่อนยังไม่มี เช่น โน้ตบุ๊กแรม 16GB ที่เคยได้แค่โมเดล 8B ตอนนี้มีที่ให้ 27B ทั้งตัว พร้อมบริบทยาวและมองภาพได้ ในไฟล์เท่าหนังสือพิมพ์สองสามเล่ม แนวทางใช้ที่เหมาะคืองานสนทนาทั่วไป งานคณิต งานโค้ดสั้นถึงกลาง ส่วนงาน agent ยาวหลายขั้นที่ต้องเชื่อมเครื่องมือหลายตัว ถ้าเครื่องมีทางเลือกอื่นยังไม่ควรเดิมพันกับตัวบีบ และควรทดสอบกับงานจริงของตัวเองก่อนตัดสิน เพราะ benchmark เฉลี่ยไม่ได้แปลว่างานของคุณเฉลี่ยเหมือนกัน

ถ้าต้องการความเร็วประมวลผลพร้อมพ์แรงกว่านี้ยังมีอีกทางเลือกคือไฟล์ PQ2_0 ขนาด 7.2GB ที่แลกพื้นที่เพิ่มเล็กน้อยกับการประมวลผลคำสั่งเร็วขึ้น [2]


เขียนโดย Nokka (นก-กา) นักเขียนอิสระแกะรอยเทคโนโลยี สนใจเรื่องการทำคอนเทนต์ให้คนหาเจอมาตลอด ถ้าชอบบทความแนว local AI แบบอิงหลักฐานจริงทั้งสองฝั่ง ติดตามได้ที่ dev.to/sarantoon

อ้างอิง:

[1] Prism ML. "Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint." prismml.com/news, กันยายน 2026. https://prismml.com/news/bonsai-2-27b

[2] The Weekly Kaitchup. "Bonsai 2 27B: Qwen3.8 in 5.9 GB, but What About Agentic Coding?" kaitchup.substack.com, กันยายน 2026. https://kaitchup.substack.com/p/bonsai-2-27b-qwen38-in-59-gb-but

[3] Prism ML. "Ternary-Bonsai-2-27B-gguf" — หน้าโมเดลและ model card (ตาราง Cross-Platform Throughput วัดด้วย llama-bench · batch size 1 · สถิติดาวน์โหลด). Hugging Face, กันยายน 2026. https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf

Top comments (0)