DEV Community

Nokka
Nokka

Posted on AI-assisted

Ternary 2-bit กับ GGUF: ทำไมโมเดล 27B ถึงรันในการ์ดจอผู้ใช้ทั่วไปได้แล้ว

Ternary 2-bit กับ GGUF: ทำไมโมเดล 27B ถึงรันในการ์ดจอผู้ใช้ทั่วไปได้แล้ว

โดย Nokka (นก-กา) | 30 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

TL;DR

เมื่อวันที่ 29 กันยายน บนกระดานเทรนด์ของ Hugging Face มีสองสัญญาณที่วางข้างกันแล้วเล่าเรื่องเดียวกันได้ บนลิสต์ที่เรียงด้วยคะแนนเทรนด์ โมเดล Qwen3.8-27B มี 16,565 ไลก์ เป็นอันดับหนึ่งของลิสต์ ส่วนยอดดาวน์โหลด 7,020,239 ครั้งใน 30 วัน เป็นอันดับ 31 ของลิสต์เดียวกัน (อันดับ 53 เมื่อเรียงทั้ง Hub ด้วยยอดดาวน์โหลด) ขณะที่

Ternary-Bonsai-2-27B ที่บีบโมเดลขนาดเดียวกันให้เหลือไฟล์ 8.6 กิกะไบต์ มียอดดาวน์โหลด 3,581,027 ครั้ง ตัวเลขทั้งสองบอกว่าคลื่นลูกใหม่ไม่ใช่โมเดลที่เก่งขึ้น แต่คือโมเดลที่รันในเครื่องคนธรรมดาได้

ตัวเลขบนกระดาน

ข้อมูลจาก API ของ Hugging Face เมื่อวันที่ 30 กันยายน 2026 ระบุว่า Qwen3.8-27B มียอดกดใจ 16,565 และยอดดาวน์โหลด 7,020,239 ครั้งในรอบ 30 วัน ตามมาด้วย Ternary-Bonsai-2-27B ซึ่งเป็นเวอร์ชันควอนไทซ์ของโมเดลตระกูลเดียวกัน

มียอดกดใจ 2,266 และยอดดาวน์โหลด 3,581,027 ครั้ง[1]

เวอร์ชัน FP8 ของโมเดลเดียวกันทำยอดดาวน์โหลด 5,169,806 ครั้งใน 30 วัน[2]

การที่โมเดล 27B ตัวหนึ่งมียอดดาวน์โหลดเกินเจ็ดล้านครั้งในหนึ่งเดือน และเวอร์ชันที่บีบอัดของตระกูลเดียวกันได้เกินสามล้านครึ่ง เป็นสัญญาณว่าโมเดลขนาดกลางกำลังถูกดึงลงเครื่องผู้ใช้จริง

ไม่ได้อยู่ในศูนย์ข้อมูลอย่างเดียว

ทำไม 27B ถึงรันในเครื่องได้

เหตุผลที่หนึ่ง: โครงสร้างความสนใจ

มีสองเหตุผลที่ทำงานร่วมกัน เหตุผลแรกคือโครงสร้างความสนใจของ Qwen3.8-27B

โมเดลนี้มีบล็อกทั้งหมด 64 ชั้น แต่มีเพียง 16 ชั้นที่เป็นความสนใจเต็มรูปแบบ ส่วนอีก 48 ชั้นใช้ Gated DeltaNet ซึ่งเป็นความสนใจแบบเชิงเส้น ความต่างคือความสนใจเต็มรูปแบบมีแคช KV ที่โตตามความยาวบริบท

ในขณะที่ความสนใจเชิงเส้นเก็บสถานะแบบเรียกซ้ำขนาดคงที่ ไม่ว่าจำนวนโทเคนจะเป็น 2,000 หรือ 200,000 หน่วยความจำของ 48 ชั้นนั้นก็เท่าเดิม[3]

ผลคือเมื่อบริบทยาวขึ้น ตัวแปรหลักในหน่วยความจำเหลือเพียงแคช KV ของ 16 ชั้น ไม่ใช่ทั้ง 64 ชั้น[3]

เหตุผลที่สองคือการควอนไทซ์ Ternary-Bonsai-2-27B ทำให้เกือบทุกน้ำหนักของโมเดลเก็บเป็นหนึ่งในสามค่า คือ -1, 0 หรือ +1 โดยใช้สเกลร่วมหนึ่งตัวต่อกลุ่ม 128 น้ำหนัก ทำให้แต่ละน้ำหนักบรรจุข้อมูลราว 1.585 บิต เทียบกับ 16 บิตใน

FP16[4]

ไฟล์รวมอยู่ที่ 8.60 กิกะไบต์ และมีการอภิปรายในชุมชนนักพัฒนาเรื่องการเพิ่มโหมดควอนไทซ์ระดับ 2 บิตเข้าสู่เอนจิน llama.cpp ในช่วงเดียวกัน[5]

ตัวเลขขนาดไฟล์ แยกเป็นโมเดลภาษา 7.67 กิกะไบต์กับเสาวิวชันแบบ FP16 อีก 0.92 กิกะไบต์ที่ยกมาทั้งดุ้น จากเดิมที่ราว 54 กิกะไบต์ใน FP16[4]

รูปแบบ ขนาด/อัตราจัดเก็บ ฮาร์ดแวร์ที่ได้เปรียบ
FP16 (ต้นฉบับ) ราว 54 GB การ์ดที่หน่วยความจำเหลือเฟือ
MLX ternary 2.25 บิตต่อน้ำหนัก แล็ปท็อป Apple Silicon
GGUF PTQ1_0 1.75 บิตต่อน้ำหนัก การ์ดรุ่น Ada และการ์ดระดับล่าง
GGUF PQ2_0 ไม่เปิดเผยชัด H100, A100, Blackwell

ราคาที่จ่ายไปกับขนาดที่ลดลง

ราคาที่จ่ายกับขนาดที่ลดลง

คำถามที่ต้องถามทุกครั้งเมื่อมีคนบอกว่าโมเดลเล็กลงเกือบเจ็ดเท่าคือ แล้วคุณภาพหายไปเท่าไหร่

การ์ดโมเดลรายงานคะแนนเฉลี่ย 84.78 จากชุดทดสอบโหมดคิด 14 ชุด ซึ่งผู้พัฒนาเทียบว่าเป็น 98.2% ของประสิทธิภาพ FP16 และชนะเวอร์ชัน IQ2_XXS ในระดับเดียวกันที่ได้ 72.59 โดยใช้พื้นที่น้อยกว่า[4]

สองอย่างที่ควรรู้เพิ่ม อย่างแรกคือตัวเลข 98.2% นี้เป็นการคำนวณของผู้พัฒนาเอง ไม่ใช่ผลทดสอบอิสระ อย่างที่สองคือรูปแบบไฟล์มีผลต่อขนาดจริงมากกว่าที่ชื่อบิตบอก คอนเทนเนอร์ MLX ใช้รูปแบบสเกลและไบแอสต่อกลุ่ม

ทำให้พื้นที่เก็บจริงเป็น 2.25 บิตต่อน้ำหนัก เทียบกับ GGUF แบบ PTQ1_0 ที่ 1.75 บิตต่อน้ำหนักจากค่าสามค่าเดียวกัน[4]

การเลือกไฟล์จึงขึ้นกับฮาร์ดแวร์ บนการ์ดรุ่น Ada และการ์ดระดับล่างที่คอขวดอยู่ที่แบนด์วิดท์หน่วยความจำ PTQ1_0 ให้ผลดีกว่า ขณะที่บน H100, A100 และการ์ด Blackwell ที่การถอดรหัสติดที่พลังประมวลผลมากกว่า PQ2_0

กลับได้เปรียบ[4]

ตัวเลขที่ทำให้เห็นภาพ

บนแล็ปท็อป Apple M5 Max การ์ดโมเดลรายงานว่าโมเดลสร้างข้อความได้ราว 47 โทเคนต่อวินาที[4] ตัวเลขนี้ไม่ได้มีไว้เทียบความเร็วกับโมเดลอื่น แต่มีไว้เป็นหลักฐานว่าโมเดลระดับ 27B รันแบบโต้ตอบได้บนฮาร์ดแวร์ผู้บริโภค

ที่ไม่สามารถโหลดเวอร์ชัน FP16 ได้เลย

อีกตัวเลขหนึ่งที่ช่วยให้เห็นทิศทางคือ Unsloth ประกาศเมื่อวันที่ 9 กันยายนว่า GGUF ของ Qwen3.8-27B ทำยอดดาวน์โหลด 10 ล้านครั้งและ 3,700 ไลก์ใน 24 วัน กลายเป็นโมเดลที่มียอดกดใจสูงสุดในหมวด GGUF ทั้งหมด และการตรวจหน้า Hugging

Face ยืนยันช่วงไลก์ 3,500-3,700 ตรงกับที่ประกาศ[3]

ตัวอย่างที่ทำให้เห็นภาพคือการเลือกไฟล์ของโมเดลเดียวกันบนเครื่องต่างกัน บนแล็ปท็อปที่คอขวดอยู่ที่แบนด์วิดท์หน่วยความจำ ไฟล์ PTQ1_0 ให้ผลดีกว่า แต่ย้ายไปรันบน H100 ที่การถอดรหัสติดที่พลังประมวลผล ไฟล์ PQ2_0 กลับได้เปรียบ คำตอบว่าไฟล์ไหนดีที่สุดจึงขึ้นกับเครื่องที่ใช้ ไม่ใช่ตัวเลขบิต

อ่านข่าวนี้ให้ถูก

ข้อควรระวังข้อแรกคือ ตัวเลข 10 ล้านดาวน์โหลดของ GGUF กับการที่ผู้ให้บริการรายอื่นอย่าง bartowski ปล่อย GGUF ตัวเดียวกันแยกกัน ทำให้ยอดดาวน์โหลดของตระกูลหนึ่งกระจายอยู่หลายที่ ถ้าต้องการเทียบความนิยมระหว่างตระกูล

ต้องบวกยอดของทุกราย ไม่ใช่ดูแค่ตัวท็อป[3]

ข้อมูลการนับดาวน์โหลดในบทความนี้เป็นตัวเลขแบบหมุน 30 วันจาก Hugging Face Hub ซึ่งรวมการดึงไฟล์จากการปรับใช้ใหม่และการรันทดสอบอัตโนมัติไว้ด้วย ไม่ได้นับเฉพาะคนที่ดาวน์โหลดไปใช้เอง[2]

ข้อที่สองคือคำอ้างของ Unsloth ที่ว่า GGUF แบบ 4 บิตให้ผลเท่ากับโมเดลเต็มบนงานเขียนโค้ดแบบเอเจนต์ ยังไม่มีใครทำซ้ำผลนั้นได้อย่างอิสระ

ผู้เขียนบทความต้นทางระบุเองว่าควรอ่านเป็นถ้อยแถลงของผู้ขาย[3] และข้อที่สามคือสิ่งที่ผมคิดว่าสำคัญที่สุดสำหรับคนที่กำลังตัดสินใจซื้อเครื่อง โมเดลระดับ 27B ที่ทำงานได้จริงบนฮาร์ดแวร์ผู้บริโภคเปลี่ยนสมการการเลือกซื้อไปแล้ว สิ่งที่ต้องถามไม่ใช่การ์ดจอไหนแรงที่สุด แต่ว่าโมเดลที่เราต้องใช้จริงนั้นกินหน่วยความจำเท่าไหร่ในรูปแบบไฟล์ที่เราจะใช้ และฮาร์ดแวร์ของเราพอไหม

ถ้าคุณกำลังเลือกซื้อเครื่องสำหรับรันโมเดลในเครื่อง ลองคำนวณจากหน่วยความจำที่โมเดลใช้จริงในรูปแบบไฟล์ที่คุณจะเลือกใช้ ไม่ใช่จากจำนวนพารามิเตอร์ และทดลองรันกับงานของคุณเองก่อนตัดสินใจลงทุน

REF

[1] Hugging Face API, "models?sort=trendingScore" (ข้อมูล ณ 30 กันยายน 2026: Qwen/Qwen3.8-27B ยอดกดใจ 16,565 และยอดดาวน์โหลด 30 วัน 7,020,239 · prism-ml/Ternary-Bonsai-2-27B-gguf ยอดกดใจ 2,266 ยอดดาวน์โหลด 3,581,027), 30 กันยายน 2026. https://huggingface.co/api/models?sort=trendingScore

[2] Digital Applied, "Which Open AI Models People Download: September 2026 Data" (ข้อมูลดาวน์โหลดจาก Hugging Face Hub ณ 18 กันยายน 2026: Qwen3.8-27B-FP8 อยู่อันดับ 43 ของลิสต์ และ 5,169,806 ดาวน์โหลด · ตาราง 60 อันดับ), กันยายน 2026. https://digitalapplied.com/blog/most-downloaded-open-ai-models-hugging-face-september-2026

[3] ThakiCloud, "The 10-Million-Download GGUF: The Day Qwen3.8-27B Made the Local Route First-Class" (ปล่อย Apache 2.0 วันที่ 14 ส.ค. 2026 · 64 บล็อก = 16 ชั้นความสนใจเต็ม + 48 ชั้น Gated DeltaNet เชิงเส้น · บริบทเดิม 262,144 ขยายถึง 1 ล้านด้วย YaRN · MTP draft head · reasoning_effort · Unsloth GGUF 10 ล้านดาวน์โหลด 3,700 ไลก์ใน 24 วัน ถึงวันที่ 9 ก.ย. · bf16 55.59GB -> Q4_K_M ~17GB -> 1 บิต ~8GB), กันยายน 2026. https://thakicloud.com/tech-blog/en/llmops/qwen38-gguf-local-inference

[4] MindStudio, "Ternary-Bonsai-2-27B: A 27B Model That Fits in 8.6GB" (น้ำหนักเป็น -1/0/+1 · 1.585 บิตต่อน้ำหนัก · 8.60GB = 7.67GB โมเดลภาษา + 0.92GB เสาวิวชัน FP16 จาก ~54GB · คะแนนเฉลี่ย 84.78 จาก 14 ชุดทดสอบโหมดคิด = 98.2% ของ FP16 เทียบ IQ2_XXS 72.59 · จัดกลุ่ม g128 · blockwise Hadamard rotation · MLX 2.25 บิต/น้ำหนัก เทียบ GGUF PTQ1_0 1.75 · M5 Max ~47 โทเคนต่อวินาที), กันยายน 2026. https://www.mindstudio.ai/blog/ternary-bonsai-2-27b-ternary-quantization

[5] Reddit r/LocalLLaMA, "Ternary Bonsai 1.58-bit models: ggml adds Q2_0 quantization" (การอภิปรายของชุมชนนักพัฒนาเรื่องโหมดควอนไทซ์ 2 บิตใน ggml), กันยายน 2026. https://www.reddit.com/r/LocalLLaMA/comments/1uqur7o/ternary_bonsai_158bit_models_ggml_add_q2_0/

Top comments (0)