DEV Community

Nokka
Nokka

Posted on AI-assisted

Gemma 4 โมเดล open ของ Google 5 ขนาด จากมือถือถึงเวิร์กสเตชัน

Gemma 4 โมเดล open ของ Google 5 ขนาด จากมือถือถึงเวิร์กสเตชัน

โดย Nokka (นก-กา) | 23 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

ต้นเรื่องจากวิดีโอ "Understand the Gemma 4 model family" ของ Google for Developers ที่เพิ่งแวะมาในฟีด [1] ครอบครัวโมเดล open ล่าสุดของ Google DeepMind ที่ออกมาตั้งแต่ปลายเดือนมีนาคม และค่อย ๆ เติมสมาชิกจนครบห้าขนาดในเดือนมิถุนายน ผมไล่อ่านหน้าประกาศ คู่มือ และ technical report ทางการแล้ว ข้อสรุปสั้น ๆ คือครั้งนี้ Google เล่นเกมต่างจากค่ายอื่น ไม่ได้แข่งว่าใครโมเดลใหญ่สุด แต่แข่งว่าใครฉลาดที่สุดต่อขนาดโมเดล หรือภาษาของเขาคือ intelligence-per-parameter

จุดที่ทำให้ผมหยุดอ่านแล้วเปิด terminal ลองเลยคือตัว 26B A4B โมเดลแบบ Mixture-of-Experts ที่มีพารามิเตอร์รวมระดับ 26B แต่กระตุ้นทำงานเพียงราว 4B ต่อโทเคน ทางการบอกตรง ๆ ว่ามันวิ่งเกือบเท่าโมเดล 4B ธรรมดา [2]

แปลว่าได้ความฉลาดระดับ 26B ด้วยความเร็วและหน่วยความจำระดับตัวเล็ก เมื่อเทียบกับค่าบริการคลาวด์ที่กำลังแพงขึ้นทุกเดือน คุณค่าของเรื่องนี้เห็นได้ทันทีสำหรับคนที่รันเอง

ตารางเทียบหน่วยความจำ Gemma 4 ทั้ง 5 ขนาดจาก E2B ถึง 31B Dense พร้อมข้อมูล context และความสามารถ

ครอบครัวห้าขนาด เลือกให้ตรงเครื่อง

Gemma 4 ออกชุดแรกสี่ขนาดเมื่อ 31 มีนาคม 2026 ในสัญญาอนุญาต Apache 2.0 แล้วเพิ่มตัวที่ห้าคือ 12B Unified ในวันที่ 3 มิถุนายน [2][3] ทั้งหมดสร้างจากงานวิจัยและเทคโนโลยีเดียวกับ Gemini 3 รับข้อความและรูปภาพได้ทุกขนาด ส่วนเสียงและวิดีโอเป็นความสามารถดั้งเดิมของ E2B, E4B และ 12B [4] หน้าต่างบริบทแบ่งสองระดับ ตัวเล็กได้ 128K และตัวใหญ่ถึง 256K โทเคน รองรับภาษามากกว่า 140 ภาษา

ขนาด สถาปัตยกรรม บริบท หน่วยความจำ Q4 เหมาะกับ
E2B ตัวเล็กสุด 128K 2.9 GB (มือถือ 1.1 GB) โทรศัพท์ อุปกรณ์ edge
E4B ตัวเล็ก 128K 4.5 GB (มือถือ 2.5 GB) แล็ปท็อป งาน reasoning บนมือถือ
12B Unified ไร้ encoder 256K 6.7 GB เวิร์กสเตชัน multimodal
26B A4B MoE 256K 14.4 GB GPU ระดับผู้ใช้ เร็วเกือบ 4B
31B Dense 256K 17.5 GB งานคุณภาพสูงสุด รีเสิร์ช

ตารางหน่วยความจำมาจากคู่มือทางการซึ่งระบุเป็นน้ำหนักโมเดลอย่างเดียว ยังไม่รวม KV cache ที่โตตามความยาวบริบท ดังนั้นคิดเผื่ออีกสักหน่อยเวลาเลือกเครื่อง [5] ตัว E2B ที่เหลือเพียง 1.1 GB บนมือถือเป็นทางการคือจุดที่ทำให้ครอบครัวนี้ต่างจากคู่แข่ง เพราะหาโมเดล open ระดับคุณภาพนี้ที่วิ่งบนโทรศัพท์ได้จริงตอนนี้มีน้อยมาก

12B Unified ตัวประหลาดของครอบครัว

ตัวที่น่าสนใจเป็นพิเศษคือ 12B Unified ที่มาช้ากว่าเพื่อน เพราะสถาปัตยกรรมต่างจากทั้งครอบครัว โมเดลทั่วไปใช้ encoder แยกสำหรับรูปและเสียงก่อนส่งเข้า LLM แต่ 12B Unified ตัด encoder ทิ้งทั้งหมด ฉาย pixel ของภาพและ waveform ของเสียงเข้า embedding space ตรง ๆ ผ่าน linear layer เบา ๆ [4] ผลคือโมเดลเดียวจบทั้งข้อความ ภาพ และเสียง ในหน่วยความจำราว 6.7 GB เมื่อควอนไทซ์ระดับ 4 บิต ซึ่งใส่ได้สบายในแม็คที่คนทำงานสายนี้ใช้กันอยู่แล้ว

ตัวเลข benchmark อ่านอย่างไร

คะแนนที่ Google เผยแพร่เองเปรียบเทียบกับ Gemma 3 27B รุ่นก่อน ตัวใหญ่ของครอบครัวนี้ข้ามไปอีกระดับ 31B ทำ MMLU Pro ได้ 85.2 ต่อ 67.6 ของรุ่นก่อน คณิตศาสตร์ AIME 2026 กระโดดจาก 20.8 ไป 89.2 และโค้ดแข่งขัน LiveCodeBench v6 จาก 29.1 ไป 80.0 [6] ตัวเลขเหล่านี้อ่านทิศทางได้ชัดว่าครอบครัวนี้เก่งขึ้นจริง ไม่ได้มีเพียงเพิ่มบริบทยาว

สิ่งที่ผมชอบคือ Google รายงานคะแนนของทุกขนาดไว้เปิดกว้าง ทำให้เห็น trade-off ชัดเจน E2B ทำ AIME ได้ 37.5 ขณะที่ 26B A4B ได้ 88.3 แทบเท่า 31B ที่ 89.2 แต่กินหน่วยความจำเวลารันน้อยกว่าครึ่งตัว นี่คือเหตุผลที่ 26B A4B กลายเป็นที่สนใจที่สุดของชุดสำหรับคนรันเอง และเป็นตัวที่ขึ้นอันดับ 6 ของ open model บน Arena ตอนเปิดตัว ขณะที่ 31B ได้อันดับ 3 [3]

ข้อควรระวังในการอ่านก็มีเหมือนงานอื่น คะแนนเหล่านี้คือการวัดของ Google เองบนชุดทดสอบที่เลือก รวมถึงโหมด thinking ที่เปิดใช้ ซึ่งแลกมาด้วยการคิดยาวขึ้นและใช้โทเคน output มากขึ้น บิลความคิดของโมเดลไม่เคยฟรี แม้ตัวโมเดลจะฟรีก็ตาม ส่วนอันดับ Arena เป็นภาพณ เวลาเปิดตัว ตารางลีดเดอร์เปลี่ยนทุกสัปดาห์ อ่านเป็นสัญญาณความแข่งขันได้ อย่าตีเป็นคำพิพากษาตลอดกาล

ตัวอย่างจริงจากเครื่องคนใช้งานจริง

พูดถึงตัวเลขแล้วขอเสริมตัวอย่างที่จับต้องได้จากการใช้งานจริง ตัว 26B A4B ถูกออกแบบให้รันบน GPU ระดับผู้ใช้อย่าง RTX 3090 หรือ 4090 และแม็คที่หน่วยความจำพอ [5] ส่วนตัว E2B มีเวอร์ชันมือถือผ่าน LiteRT-LM ที่หน่วยความจำข้อความล้วนเหลือเพียง 0.84 GB ซึ่งใส่ได้แม้ในโทรศัพท์ระดับกลาง สองตัวอย่างนี้คือขอบทั้งสองด้านของครอบครัว จากเครื่องเร็กเล็กในกระเป๋าถึงเวิร์กสเตชันบนโต๊ะ

ระบบนิเวศที่โตเร็วกว่าตัวเลขตั้งต้น

ประเด็นที่คนมองข้ามคือแรงส่งของชุมชน ณ วันเปิดตัว Gemma ถูกดาวน์โหลดไปแล้วเกิน 400 ล้านครั้งนับตั้งแต่รุ่นแรก และครบ 1,000 ล้านครั้งเมื่อ 20 สิงหาคม 2026 พร้อม variant ที่ชุมชนสร้างต่อเกินหนึ่งแสนตัว [7]

ตัวเลขนี้สำคัญเพราะโมเดล open ที่ไม่มีคนใช้จะไม่มีเครื่องมือ ไม่มีสูตร fine-tune และไม่มีคนแก้บั๊กให้ ครอบครัวนี้ผ่านด่านนั้นมาแล้วแบบขาดลอย

ฝั่ง Android ยิ่งน่าสนใจ Google ปล่อย Gemma 4 เข้าโปรแกรม AICore Developer Preview ตั้งแต่ต้นเดือนเมษายน ให้นักพัฒนาทดสอบบนเครื่องจริงทั้งคู่ E4B สำหรับงานคิดหนักและ E2B ที่เร็วกว่าสามเท่าสำหรับงานเร็ว ๆ [8]

ตัวเลขที่ Google ระบุคือเร็วขึ้นสี่เท่าและประหยัดแบตเตอรี่ลงราว 60 เปอร์เซ็นต์จากรุ่นก่อน พร้อมประกาศชัดว่าโมเดลชุดนี้คือฐานของ Gemini Nano 4 ที่จะมากับอุปกรณ์ปลายปีนี้ โค้ดที่เขียนให้ Gemma 4 วันนี้จะได้ผลลัพธ์ต่อเนื่องบนมือถือรุ่นใหม่ ล่าสุดวันแรกของกันยายน Android Studio รุ่น Quail ยังฝัง Gemma 4 เป็นเครื่องมือ local ในตัว IDE เลย

อีกของที่นักรันเองควรรู้คือชุด Multi-Token Prediction ที่ปล่อยกลางเดือนเมษายน เทคนิคให้โมเดลเดาข้อความล่วงหน้าหลายโทเคนพร้อมกันช่วยเร่ง inference ได้ถึงสามเท่าโดยไม่ต้องแลกคุณภาพ [7] รวมเป็นเหตุผลที่ทำให้ครอบครัวนี้ดูเป็นงานวิศวกรรมครบวงจรมากกว่าแค่ปล่อยน้ำหนักโมเดลแล้วจบ

มุมของคนรันเอง

สำหรับคนไทยที่สนใจรันโมเดลเองเหมือนผม แผนที่การเลือกง่ายขึ้นเยอะเมื่อรวมข้อมูลข้างต้น เครื่องเฉลี่ยแรม 16 GB เริ่มได้เล่นตั้งแต่ E4B ควอนไทซ์ จนถึง 12B Unified ถ้าเครื่อง 24 GB ขึ้นไป 26B A4B ที่ 14.4 GB เป็นจุดหวานที่สุดของชุด ส่วน 31B dense ที่ 17.5 GB ให้คุณภาพสูงสุดแต่ช้ากว่าและหนักกว่าชัดเจน เพราะกระตุ้นครบทุกพารามิเตอร์ทุกโทเคน

สัญญาอนุญาต Apache 2.0 แบบไม่มีเพดานผู้ใช้ก็คือจุดต่างสำคัญจากคู่แข่งสาย open ที่หลายรายมีเงื่อนไขรายได้หรือจำนวนผู้ใช้ ทีมสตาร์ทอัพที่อยากฝังโมเดลลงผลิตภัณฑ์ไม่ต้องกังวลเรื่องนี้กับ Gemma 4

ถ้าถามว่าควรเริ่มจากตัวไหน คำตอบของผมคือลอง 26B A4B กับงานจริงของคุณก่อน แล้วไล่ลงมาหา E4B หรือ E2B ที่ยังรับได้ วิธีนี้เร็วกว่าเริ่มจากตัวเล็กแล้วผิดหวัง เพราะความต่างระหว่างขนาดในครอบครัวนี้กว้างกว่าที่ตัวเลขขนาดบอก โดยเฉพาะงานคณิตและโค้ดที่ E4B ทำได้ 42.5 บน AIME ขณะที่ 26B A4B ทำได้ 88.3 [6]

ปิดท้ายด้วยมุมกว้าง สงครามโมเดลปีนี้เลื่อนสนามจากใครเก่งที่สุดไปเป็นใครคุ้มที่สุดต่อทรัพยากร ทั้งในเชิงราคา API และขนาดโมเดลที่รันได้จริงบนเครื่องคน Gemma 4 คือหมัดในแนวนี้ของ Google ตอนที่ค่ายอื่นยังแข่งกันที่ตัวเลข benchmark เปล่า ๆ จะน่าสนใจว่าค่ายอื่นอย่างอาลีบาบาที่ดูแลตระกูลคิวเวน (Qwen) จะตอบโต้แบบไหนในรอบถัดไป

อ้างอิง:

[1] Google for Developers. "Understand the Gemma 4 model family." YouTube, 2026. https://www.youtube.com/watch?v=4oxA9o_OmWo

[2] Google DeepMind. "Gemma 4 model card." ai.google.dev, 2026. https://ai.google.dev/gemma/docs/core/model_card_4

[3] Farabet C. และ Lacombe O. "Gemma 4: Byte for byte, the most capable open models." blog.google, 2 เมษายน 2026. https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/

[4] Google DeepMind. "Gemma 4 Technical Report." arXiv, 2026. https://arxiv.org/html/2607.02770v1

[5] Google AI for Developers. "Gemma 4 model overview." ai.google.dev, 2026. https://ai.google.dev/gemma/docs/core

[6] Google DeepMind. "Gemma 4 Performance." deepmind.google, 2026. https://deepmind.google/models/gemma/gemma-4/

[7] Google. "Gemma passes 1 billion downloads." blog.google, 20 สิงหาคม 2026. https://blog.google/innovation-and-ai/technology/developers-tools/gemma-one-billion-downloads/

[8] Chou D. และ Chang C. "Announcing Gemma 4 in the AICore Developer Preview." android-developers.googleblog.com, 2 เมษายน 2026. https://android-developers.googleblog.com/2026/04/AI-Core-Developer-Preview.html

Top comments (0)