โดย Nokka (นก-กา) | 22 กันยายน 2569
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
ข่าวจาก Prism ML สัปดาห์นี้คือ Ternary Bonsai 2 27B โมเดลที่บีบ Qwen3.8 ขนาด 27B จนเหลือไฟล์ราว 5.9GB พร้อมโฆษณาว่าคงความสามารถไว้ 98.2% ของต้นแบบเต็มความละเอียด ใครใช้เครื่องที่แรมไม่มากก็เริ่มหวังว่าจะรันโมเดลระดับนี้ได้ในเครื่องจริง ๆ
แต่ตัวเลข 98.2% นี้มีเรื่องเล่าเบื้องหลังมากกว่าที่โฆษณา เราจึงรวมทั้งประกาศของผู้ทำและบทวิเคราะห์อิสระที่ไล่อ่านงานวิจัยจริงมาเล่าให้ครบทั้งสองฝั่ง ให้คุณตัดสินเองว่าควรโหลดมาลองหรือรอต่อ
ฝั่งที่หนึ่ง: ผลจากผู้ทำ ตัวเลขน่าประทับใจจริง
จุดเริ่มของ Bonsai 2 คือเทคนิคการบีบน้ำหนักแบบ ternary คือให้ค่าน้ำหนักเหลือแค่สามสถานะ (ลบหนึ่ง ศูนย์ บวกหนึ่ง) คูณด้วยสัดส่วนกลุ่มละ 128 ค่า ทำให้ได้ความหนาแน่นเฉลี่ย 1.76 บิตต่อน้ำหนักหนึ่งค่า ไฟล์ทั้งโมเดลจึงเหลือ 5.9GB จากต้นแบบที่ใหญ่กว่าเก้าเท่าตัว [1]
ตัวเลขเชิงความสามารถที่ผู้ทำรายงาน: คะแนนรวมทุกด้าน 83.9 เทียบกับ 85.4 ของต้นแบบเต็ม (คงไว้ 98.2%) (หมายเหตุ: ตัวเลขในชุดประกาศนี้วัดจากชุด benchmark ของ Prism ML ซึ่งต่างจากตารางในหน้าโมเดล Hugging Face ที่ใช้ชุดวัดอีกแบบ [3] ผลไปทางเดียวกันแต่ตัวเลขไม่เท่ากันเป๊ะ) โดยรายด้านน่าสนใจว่า งานคณิตศาสตร์เกือบไม่หายไปเลย (96.57 เทียบ 97.06) ตามด้วยการเขียนโค้ด 81.58 เทียบ 82.17 และการเรียนตามคำสั่งกลับดีกว่าต้นแบบด้วยซ้ำ (82.66 เทียบ 81.25) ส่วนที่หายมากสุดคือด้านการมองภาพ (78.59 เทียบ 81.64) [1]
ข้อกำหนดใช้งานที่คนสนใจจะอยากรู้: รองรับบริบทยาว 262K โทเคน รับข้อความและภาพ และเป็นสัญญาอนุญาต Apache 2.0 ใช้เชิงพาณิชย์ได้ [1]
ฝั่งที่สอง: บทวิเคราะห์อิสระชี้จุดที่โฆษณาไม่บอก
Kaitchup ซึ่งเคยทดสอบ Bonsai รุ่นแรกมาก่อน ออกบทวิเคราะห์สัปดาห์เดียวกัน มีสามข้อสังเกตที่ควรรู้ก่อนตัดสินใจ [2]
ตัวเลข 98.2% เป็นค่าเฉลี่ย ไม่ใช่การรับประกันทุกด้าน
ค่านี้คิดจากอัตราส่วนของคะแนนเฉลี่ยรวม ไม่ใช่สัญญาว่าทุกงานเหลือเท่าเดิม งานที่มักพังก่อนเวลาอันควรเมื่อโมเดลถูกบีบคืองานยาวหลายขั้นตอนอย่าง coding agent ที่ความผิดพลาดเล็ก ๆ สะสมกันเป็นความพังใหญ่ [2]
ผล agentic coding รายงานแยกนอกตารางหลัก
น่าสนใจว่าทีมผู้ทำทดสอบงาน agentic coding จริง แต่ไม่ได้ใส่ตัวเลขไว้ในตารางหลักที่ทุกคนเห็น ทำให้ค่า 98.2% ดูเกินจริงสำหรับงานกลุ่มนี้โดยเฉพาะ ทั้งที่การทำงานแบบ agent ยาว ๆ คือจุดที่โมเดลที่ถูกบีบต่างจากต้นแบบชัดที่สุด [2]
วิธีวัดมีข้อจำกัดที่ควรรู้
การทดสอบความแม่นทั้งหมดวัดจากโมเดลคลายแพ็กผ่าน vLLM บนการ์ด H100 ไม่ใช่การวัดจากไฟล์ GGUF บีบจริงที่วิ่งบนเครื่องผู้ใช้ และตั้งลิมิตคำตอบไว้แค่ 82K โทเคน ซึ่งเทียบกับโหมดคิดยาวแล้วถือว่าต่ำ ผู้วิเคราะห์จึงเตือนว่าผลที่เห็นเป็นการวัดความแม่นของโมเดล ไม่ใช่ประสบการณ์จริงบนสแตกที่บีบแล้ว [2]
มีข้อจำกัดเชิงปฏิบัติอีกจุด: Bonsai 2 ต้องใช้ runtime ของ Prism ML เอง เพราะมีการแปลงค่า activation คู่กับน้ำหนักที่ llama.cpp ปกติยังไม่รองรับ [2] ไฟล์โมเดลทั้งสองฟอร์แมต (PTQ1_0 ที่ 5.9GB และ PQ2_0 ที่ 7.2GB) ดาวน์โหลดได้จาก Hugging Face [3]
ความเร็วที่วัดจริง: การบีบคือสิ่งที่ทำให้เร็วตั้งแต่แรก
คำถามที่ทุกคนถามต่อจาก "เล็กจริงไหม" คือ "แล้วเร็วแค่ไหน" คำตอบจากตารางวัดจริงในหน้าโมเดลทางการ (วัดด้วย llama-bench ที่ batch size 1) อ่านออกมาได้สามข้อสำคัญ [3]
ยิ่งบีบยิ่งเร็ว เพราะคอขวดคือแบนด์วิดท์หน่วยความจำ
การสร้างคำ (decode) เป็นงานที่ต้องอ่านน้ำหนักทั้งโมเดลทุกโทเคน ตัวเลขจริงจากเครื่องทดสอบ: โน้ตบุ๊ก Apple M5 Pro สตรีมน้ำหนักอยู่ที่ราว 204 GB ต่อวินาที [3] คิดง่าย ๆ คือ
- Bonsai 2 ขนาด 5.9GB ผ่านได้ราว 34-35 โทเคน/วินาทีในทางทฤษฎี วัดได้จริง 28.1 โทเคน/วินาที
- ต้นแบบ FP16 ขนาด 54GB ถ้ารันได้จะเหลือราว 3.8 โทเคน/วินาทีเท่านั้น แต่ของจริงคือใส่ไม่พอตั้งแต่แรก
แปลว่าไฟล์ที่เล็กลง 9.3 เท่าไม่ได้แลกกับความเร็ว แต่กลับกัน ไฟล์เล็กคือสิ่งที่ทำให้เร็วขึ้นราว 9 เท่าบนฮาร์ดแวร์เดียวกัน เพราะต้องอ่านข้อมูลน้อยกว่าในการผลิตทุกโทเคน
การ์ดเกมราคาสองหมื่นบาทชนะการ์ดดาต้าเซ็นเตอร์หลักแสน
ตัวเลขที่ทำให้หลายคนต้องอ่านซ้ำ: RTX 5090 การ์ดสำหรับเครื่องเกมทั่วไปสร้างคำได้ 129.9 โทเคน/วินาที ชนะ H100 การ์ดดาต้าเซ็นเตอร์ที่ได้แค่ 113.9 ขณะที่ A100 รุ่นเก่ากว่าได้เพียง 73.9 ซึ่งตามหลังการ์ด RTX 4090 สำหรับผู้ใช้ทั่วไปด้วยซ้ำ เหตุผลคือที่ batch size 1 งานนี้ขับเคลื่อนด้วยแบนด์วิดท์หน่วยความจำซึ่งการ์ดระดับผู้บริโภครุ่นใหม่มีมากพอแล้ว ใครรันเพื่อใช้คนเดียวแล้วไปเช่า GPU ดาต้าเซ็นเตอร์คือเผาเงินเปล่าสำหรับงานนี้
จุดที่ต้องระวังบนโน้ตบุ๊ก: อ่านบริบทยาวคืออีกเรื่อง
การสร้างคำ 28.1 โทเคน/วินาทีบน M5 Pro ถือว่าลื่นพอคุยสนทนาได้สบาย แต่การกลืนบริบทตั้งต้น (prompt processing) บนเครื่องเดียวกันได้เพียง 387 โทเคน/วินาที หารด้วยบริบทสูงสุด 262K โทเคนเต็ม ๆ หมายถึงต้องรอราวสิบเอ็ดนาทีก่อนเริ่มตอบได้ ขณะที่ RTX 5090 ทำเรื่องเดียวกันจบในราวหนึ่งนาที
ดังนั้นคำโฆษณา "บริบท 262K บนโน้ตบุ๊ก" จริงแต่ต้องอ่านต่อให้จบ: ใช้ได้สบายกับการคุยที่บริบทสะสมค่อย ๆ โต แต่ถ้าจะอัดเอกสารยาวระดับแสนโทเคนเข้าไปทีเดียวแล้วถาม เตรียมใจรอ อีกจุดที่ควรรู้คือโมเดลนี้คิดก่อนตอบเป็นค่าเริ่มต้น (โหมด xhigh) การคิดยาวพันโทเคนบนเครื่องโน้ตบุ๊กคือรอเกือบสี่สิบวินาทีก่อนเห็นคำตอบแรก เอกสารแนะนำให้ลดเป็นโหมด medium เพื่อสมดุล
ตัวเลขสนุกอีกอัน: โมเดลนี้ถูกดาวน์โหลดไปแล้วกว่า 2.5 ล้านครั้งภายในห้าวันแรกบน Hugging Face [3] และไฟล์สองฟอร์แมตไม่ได้ตัวไหนเร็วกว่ากันเสมอ ไฟล์ PTQ1_0 ตัวเล็กชนะบนการ์ดรุ่นก่อน ส่วน PQ2_0 ตัวใหญ่กว่าชนะบนการ์ดรุ่นใหม่เพราะแกะบิตเร็วกว่า [3]
บทสรุปจากสองฝั่ง: ใช้ได้ แต่รู้ว่ากำลังได้อะไร
คำสรุปของผู้วิเคราะห์เอง ซึ่งเราเห็นด้วยคือ "Bonsai 2 27B น่าจะเป็นโมเดลที่ดีที่สุดที่รันได้ในหกกิกะไบต์" ข้อวิจารณ์ทั้งหมดมุ่งไปที่วิธีสื่อสารผลมากกว่าตัวโมเดล [2]
ผมมองว่าสำหรับคนใช้เครื่องแรมจำกัด Bonsai 2 เปิดทางที่เมื่อเดือนก่อนยังไม่มี เช่น โน้ตบุ๊กแรม 16GB ที่เคยได้แค่โมเดล 8B ตอนนี้มีที่ให้ 27B ทั้งตัว พร้อมบริบทยาวและมองภาพได้ ในไฟล์เท่าหนังสือพิมพ์สองสามเล่ม แนวทางใช้ที่เหมาะคืองานสนทนาทั่วไป งานคณิต งานโค้ดสั้นถึงกลาง ส่วนงาน agent ยาวหลายขั้นที่ต้องเชื่อมเครื่องมือหลายตัว ถ้าเครื่องมีทางเลือกอื่นยังไม่ควรเดิมพันกับตัวบีบ และควรทดสอบกับงานจริงของตัวเองก่อนตัดสิน เพราะ benchmark เฉลี่ยไม่ได้แปลว่างานของคุณเฉลี่ยเหมือนกัน
ถ้าต้องการความเร็วประมวลผลพร้อมพ์แรงกว่านี้ยังมีอีกทางเลือกคือไฟล์ PQ2_0 ขนาด 7.2GB ที่แลกพื้นที่เพิ่มเล็กน้อยกับการประมวลผลคำสั่งเร็วขึ้น [2]
เขียนโดย Nokka (นก-กา) นักเขียนอิสระแกะรอยเทคโนโลยี สนใจเรื่องการทำคอนเทนต์ให้คนหาเจอมาตลอด ถ้าชอบบทความแนว local AI แบบอิงหลักฐานจริงทั้งสองฝั่ง ติดตามได้ที่ dev.to/sarantoon
อ้างอิง:
[1] Prism ML. "Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint." prismml.com/news, กันยายน 2026. https://prismml.com/news/bonsai-2-27b
[2] The Weekly Kaitchup. "Bonsai 2 27B: Qwen3.8 in 5.9 GB, but What About Agentic Coding?" kaitchup.substack.com, กันยายน 2026. https://kaitchup.substack.com/p/bonsai-2-27b-qwen38-in-59-gb-but
[3] Prism ML. "Ternary-Bonsai-2-27B-gguf" — หน้าโมเดลและ model card (ตาราง Cross-Platform Throughput วัดด้วย llama-bench · batch size 1 · สถิติดาวน์โหลด). Hugging Face, กันยายน 2026. https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf

Top comments (0)