DEV Community

Nokka
Nokka

Posted on AI-assisted

มี GPU แรง ๆ แต่รัน AI ไม่เป็น? เว็บนี้ทำ 'สูตรสำเร็จ Local AI' ให้ดูแบบเปิดหมดบน GitHub

มี GPU แรง ๆ แต่รัน AI ไม่เป็น? เว็บนี้ทำ "สูตรสำเร็จ Local AI" ให้ดูแบบเปิดหมดบน GitHub

โดย Nokka (นก-กา) | 26 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

ช่วงที่ผ่านมาเราเห็นโมเดล Open Source เก่งขึ้นเรื่อย ๆ แต่ปัญหาของคนส่วนใหญ่ไม่ใช่ตัวโมเดล

ปัญหาคือ การมีไฟล์โมเดลอยู่บน Hugging Face กับการทำให้มัน "รันได้ดีจริงบนเครื่องของเรา" เป็นคนละเรื่องกันเลย

คำถามที่ตามมาก็ไม่ยอมใครเลย: ต้องเลือก quantization แบบไหน? VRAM จะพอหรือเปล่า? ใช้ vLLM, SGLang หรือ ExLlama ตัวไหนดี? ถ้ามี GPU หลายตัวหรือ DGX Spark หลายเครื่อง จะเชื่อมกันยังไง?

นี่คือสิ่งที่เว็บไซต์ Mia's AI Lab พยายามเข้ามาช่วยแก้ [1]

เว็บนี้คืออะไร?

Mia's AI Lab เป็นเว็บไซต์และชุดโครงการ Open Source ที่โฟกัสเรื่อง Local AI และ LLM โดยเฉพาะ ริเริ่มและดูแลโดยนักพัฒนาคนเดียวที่ตั้งชื่อเว็บตามตัวเองว่า "Mia" (repo แต่ละตัวเปิดรับ contribution จากชุมชน) ผู้ที่อธิบายตัวเองไว้บนหน้าเว็บว่าเป็นคนที่ "ได้แตะอะไรที่รัน AI ในเครื่องก็ติด" (got hooked on running AI locally) [2]

แทนที่จะสร้าง Chatbot อีกตัวหนึ่ง เว็บนี้ทำหน้าที่เหมือน "ห้องทดลอง" ที่นำโมเดลมาทดลองบนฮาร์ดแวร์จริง แล้วเผยแพร่ recipe, configuration, patch, script และ benchmark ออกมาให้คนอื่นนำไปทดลองต่อ ไม่ใช่เอาสิ่งที่ทดลองได้ปิดไว้ในห้องแล็บ

หน้า Models ของเว็บระบุชัดเจนว่าข้อมูลนี้เป็น "free, open-source recipes for NVIDIA DGX Sparks and RTX GPUs" โดยมี recipes 16 ชุด [1] พร้อมเครื่องมือ sparkDash ที่กำลังจะพูดถึงต่อไป ยอด stars รวมของ 16 recipes บวก sparkDash ณ ตอนที่เขียนบทความนี้ อยู่ที่ประมาณ 5,000 กว่าดวง (ข้อมูลเก็บจากหน้าเว็บเมื่อ 26 ก.ย. 2026, หน้าเว็บระบุว่า "GitHub numbers update every 15 minutes" ตัวเลขจึงปรับใหม่อัตโนมัติทุก 15 นาที)

Recipe ต่างจากการดาวน์โหลดโมเดลธรรมดายังไง?

สมมติเราเจอ LLM ตัวหนึ่งที่อยากใช้

การดาวน์โหลด weights มาได้เป็นเพียงจุดเริ่มต้น ส่วนที่ยากกว่าคือคำถามต่อจากนั้น: โมเดลต้องใช้ memory เท่าไร, จะ quantize แบบไหน, engine ตัวไหนเหมาะที่สุด, context ยาวได้แค่ไหน และควรเปิด server ด้วย parameter อะไร

Recipe ของ Mia's AI Lab พยายามรวมเรื่องเหล่านี้ไว้ใน repository เดียว [4]

ตัวอย่างชุด Qwen3.8 27B สำหรับ NVIDIA GPU ตั้งแต่ 16–32 GB: script ตรวจ VRAM ของการ์ดที่เจอ แล้วเลือก quant (ระดับบีบอัดโมเดล) ที่พอดีเครื่องโดยอัตโนมัติ รวมถึงสร้าง environment, ดาวน์โหลด weights และเปิด OpenAI-compatible API endpoint ให้เสร็จในชุดเดียว ทั้งบน Windows และ Linux [4]

พูดง่าย ๆ คือ จากเดิมที่เราต้องไล่อ่านกระทู้ GitHub และลองคำสั่งเองหลายชั่วโมง เขาพยายามเปลี่ยนมันให้ใกล้เคียง "ชุดติดตั้งสำเร็จรูป" มากขึ้น

จุดที่ผมชอบ: มีตัวเลขให้ดูก่อนตัดสินใจ

หน้าเว็บไม่ได้บอกเพียงว่าโมเดลไหนรันได้ แต่แสดงข้อมูลอย่าง token/s, peak throughput, prefill, context window และจำนวน DGX Spark หรือประเภท GPU ที่ต้องใช้

ตัวเลขบนหน้าเว็บวันนี้

ตารางนี้คือตัวอย่างที่หยิบมาจากหน้า Models ณ วันที่ 26 ก.ย. 2026:

โมเดล ฮาร์ดแวร์ที่ต้องใช้ Engine · Quant Decode (1 stream) Peak Context
GLM 5.3 Flash 2–4 Sparks vLLM · EXL3 4-bit 36.1 tok/s 75 tok/s ×4 สูงสุด 1M
DeepSeek V4 Flash 2–3 Sparks vLLM · DSpark · vision 38.6 tok/s 139 tok/s ×6 1M
Qwen3.8 Flash Next 1 Spark vLLM · NVFP4 · vision 48.7 tok/s 163 tok/s ×8 262k (512k ด้วย YaRN)
Qwen3.8 27B RTX 5090 vLLM · NVFP4 · MTP ~160 tok/s ไม่เผยแพร่ 262k

หมายเหตุ: GLM 5.3 Flash ถูกป้ายว่า "Mia's Favorite" ส่วนชุด RTX 5090 ออกแบบให้ทำงานแบบ single-session [1]

สำหรับคนกำลังตัดสินใจซื้อหรือประกอบเครื่อง Local AI ข้อมูลแบบนี้มีประโยชน์มาก อย่างน้อยก็ทำให้เห็นภาพว่าฮาร์ดแวร์ระดับต่าง ๆ ทำอะไรได้ประมาณไหน

ฝากไว้ให้ดูแบบ "ผลการทดลองของผู้สร้าง recipe" จะถูกต้องกว่า ไม่ใช่คะแนนมาตรฐานสากล ความเร็ว LLM เปลี่ยนได้ตาม prompt, context, concurrency, quantization และ software stack ผู้เขียนบทความนี้ (ผมเอง) ไม่ได้ทดสอบเครื่องมือนี้บนเครื่องของตัวเอง จึงรายงานตัวเลขตามที่ Mia ระบุไว้บนหน้าเว็บและ README ของแต่ละ recipe เท่านั้น

เสียงจากคนที่ลองใช้จริง

ตัวเลขสวยอย่างเดียวไม่พอ เพราะสิ่งที่ผู้ใช้ต้องเจอจริงไม่ใช่ความเร็ว แต่เป็นคุณภาพของคำตอบ

ในเคสของ recipe Qwen3.8-Flash-Next บน Spark เครื่องเดียว มีผู้ใช้อย่างน้อยสองคนบนกระทู้ DGX Spark ของ NVIDIA Developer Forums รายงานตรงกันว่าได้ความเร็วจริงตามที่โฆษณา แต่คุณภาพโมเดลลดลงเมื่อเทียบกับ recipe ทางเลือกที่บีบอัดน้อยกว่า ผู้ใช้รายหนึ่งเขียนไว้เมื่อ 5 ก.ย. 2026 ว่า "ด้านความเร็วมันยอดมาก แต่ดูเหมือน quantization ทำให้โมเดลแย่ลงพอสมควร" อีกรายบอกว่าตนเอง "ผิดหวังกับคุณภาพโมเดลจริง ๆ" (ทั้งสองข้อความแปลจากต้นฉบับภาษาอังกฤษ) แม้จะยกให้วิศวกรรมเบื้องหลังน่าประทับใจ ทั้ง throughput สูง, KV cache ขนาดใหญ่, context ยาว และการรองรับ multimodal บน Spark เครื่องเดียว [6]

ฝั่งที่ชื่นชมก็มีไม่น้อย ในกระทู้ DeepSeek V4 Flash อีกกระทู้ ผู้ใช้รายงานว่า recipe ตัวนี้ทำงานได้ดีและใช้เป็นโมเดลหลักบนเครื่องตัวเองแล้ว [7]

อ่านรวมกันแล้ว ข้อสรุปที่ยุติธรรมคือ Mia's AI Lab เก่งเรื่องรีดประสิทธิภาพบนฮาร์ดแวร์เฉพาะทางมาก แต่การรีดประสิทธิภาพแลกมาด้วยการบีบอัดที่หนักกว่าในบาง recipe ถ้าคุณซีเรียสเรื่องคุณภาพคำตอบมากกว่าความเร็ว ควรลองเทียบกับ recipe ทางเลือกบนฮาร์ดแวร์เดียวกันก่อนตัดสินใจ

อีกฟีเจอร์ที่เข้ากับยุค Agent มาก

หน้าเว็บมีแนวคิดที่เข้ากับยุค Agent มาก นั่นคือโหมด Install with an AI agent

ผู้ใช้สามารถนำ prompt ไปใส่ใน coding agent อย่าง Claude Code หรือ Codex ที่สามารถรัน command บนเครื่อง จากนั้น agent จะอ่าน recipe, ปรับ configuration ตามระบบ, เปิด server และตรวจสอบว่าทำงานหรือไม่ หน้าเว็บระบุว่าโหมดนี้ "รันได้บนเครื่องที่จะเสิร์ฟโมเดล (head node สำหรับคลัสเตอร์ Spark) เช่น Claude Code หรือ Codex" [1]

นี่คือภาพอนาคตของซอฟต์แวร์ที่น่าสนใจมาก

เมื่อก่อนเราอ่าน README แล้วพิมพ์คำสั่งตาม วันนี้เราอาจส่ง README ให้ AI แล้วบอกว่า "ติดตั้งอันนี้ให้เข้ากับเครื่องฉัน" จากนั้น agent เป็นคนจัดการรายละเอียดส่วนใหญ่ให้

แต่ใครที่เคยใช้ coding agent รันคำสั่งติดตั้งรู้ดีว่ามันไม่ได้เนียนขนาดนั้น

agent สามารถหลงทางในเครื่องที่ตั้งค่าแปลก ๆ ดาวน์โหลดผิดชุด หรืออ่านเจอ dependency ที่ build ไม่ผ่าน แล้วเลือกวิธีแก้อันตราย เช่น sudo rm โฟลเดอร์เก่า หรือเปลี่ยน system library แบบไม่ถาม คำแนะนำคือใช้บนเครื่อง sandbox หรือเครื่องที่พังได้ ไม่ควรเปิด agent ให้รันตามสบาย

ยังมี sparkDash เอาไว้ดูว่าเครื่องกำลังทำอะไร

Mia's AI Lab ยังมีโครงการชื่อ sparkDash Web Dashboard สำหรับดู DGX Spark หรือเครื่อง Linux ที่ใช้ NVIDIA GPU หลายเครื่องในหน้าจอเดียว

ดูได้ตั้งแต่ GPU, CPU, memory, storage และ network ไปจนถึง LLM metrics และความเร็ว token/s [3] แถมมี decode benchmark ในตัว และยังเชื่อมกับ vLLM ของตัวเองได้ด้วย โดยแสดง KV cache %, TTFT p95 และ prefix cache ตรง ๆ [3]

สำหรับคนทำ Local AI Lab จริง ๆ เครื่องมือประเภทนี้มีประโยชน์มาก เพราะปัญหาไม่ได้จบหลังจากโมเดลเปิดติด แต่เรายังต้องดูอีกว่า bottleneck อยู่ตรงไหน และเครื่องถูกใช้งานหนักแค่ไหน

แล้วทำไมช่วงนี้ DGX Spark ถึงน่าสนใจ?

NVIDIA DGX Spark ใช้ชิป GB10 Grace Blackwell และมี coherent unified memory 128 GB แบนด์วิดท์ 273 GB/s ระบุว่าใช้พัฒนาและทดลองโมเดล AI ขนาดใหญ่ได้บนเครื่องตั้งโต๊ะ [5]

เครื่องเดียวรองรับโมเดลราว 200 พันล้านพารามิเตอร์ ถ้าเชื่อมกัน 4 เครื่องผ่าน ConnectX-7 ก็รองรับถึง 700 พันล้านพารามิเตอร์ [5]

นี่จึงทำให้เกิด ecosystem ใหม่ของคนที่อยากมี "AI Server ส่วนตัว" บนโต๊ะทำงาน และ Mia's AI Lab ก็กำลังจับพื้นที่นี้โดยตรง

เว็บนี้เหมาะกับใคร?

ถ้าคุณเป็น Developer, AI Engineer, นักวิจัย, คนทำ Homelab หรือมี RTX GPU อยู่แล้วและอยากศึกษาการรัน LLM ด้วยตัวเอง เว็บนี้น่าจะมีของให้เล่นเยอะมาก

โดยเฉพาะคนที่อยากเรียนเรื่อง quantization, inference server, multi-node inference หรือการ optimize LLM บนฮาร์ดแวร์จริง

ข้อควรระวังก่อนเข้าไปใช้

  • ตัวเลขทั้งหมดเป็นการวัดของเจ้าของเว็บเอง ไม่ใช่การทดสอบอิสระ วัดบนคลัสเตอร์ Spark ของ Mia เอง และตัวเลขบนหน้าเว็บปรับใหม่อัตโนมัติทุก 15 นาที ให้เช็คที่ recipe ปัจจุบันเสมอ
  • ไม่มีทีมสนับสนุนระยะยาว เป็นโครงการส่วนตัวที่ Mia ดูแลเองเป็นหลัก แม้แต่ละ repo จะเปิดรับ contribution จากชุมชน ถ้าคุณเอาไปใช้ในงาน production ควรทำความเข้าใจโค้ดด้วยตัวเองก่อน ไม่ใช่เชื่อตาม recipe เฉย ๆ
  • Install with an AI agent มีความเสี่ยง ให้ agent รันคำสั่งติดตั้งบนเครื่องจริง ควรทำใน sandbox หรือเครื่องที่พังได้
  • เจ้าของเว็บมีบริการติดตั้งแบบเสียเงิน หน้า Services เปิดรับ "Personal Install by Mia" สำหรับ 1, 2 และ 4 เครื่องผ่าน Whop ส่วนตัว recipe ฟรีทั้งหมดบน GitHub ⇒ เกณฑ์เปรียบเทียบในเว็บจึงไม่ได้มาจากคนที่ไม่มีส่วนได้ส่วนเสีย [1]
  • หากคุณไม่มี DGX Spark ส่วนใหญ่ของ recipes เน้น hardware เฉพาะเจาะจง (นับตามตัวกรองบนหน้าเว็บ, recipe เดียวปรากฏได้หลายกลุ่ม: 1 Spark 7 ชุด, 2 Sparks 5 ชุด, 3 Sparks 3 ชุด) ส่วน RTX 5090 มี 3 ชุด, RTX PRO 6000 มี 4 ชุด และการ์ดสามัญ 16–32 GB มี 1 ชุด ถ้าการ์ดของคุณไม่ตรงกลุ่มนี้ ตัวเลือกอาจน้อยกว่าที่คิด

เว็บนี้ไม่ใช่กล่องวิเศษที่พอคลิกเดียวแล้วเครื่องจะรัน AI เองได้ แต่ถ้าคุณมีฮาร์ดแวร์ตรงกลุ่ม และอยากเรียนรู้การติดตั้ง Local AI แบบมีตัวเลขจริงให้เทียบ นี่เป็นจุดเริ่มต้นที่ดีมากจากผู้สร้างคนเดียวที่ทำงานนี้ในเชิงเปิด

ส่วนคุณล่ะครับ กำลังรันโมเดลอะไรอยู่บนเครื่องตัวเอง หรือยังติดอยู่ตรงขั้นตอนไหน ลองเข้าไปดูหน้า Models ของ Mia's AI Lab แล้วเล่าให้ฟังหน่อยว่า recipe ไหนน่าสนใจสุด


อ้างอิง:

[1] Mia's AI Lab. "Models: free, open-source recipes for NVIDIA DGX Sparks and RTX GPUs." mia-ai.net, 2026. https://mia-ai.net/models (เข้าถึง 26 ก.ย. 2026)

[2] Mia's AI Lab. "About: Local AI, tested in the open." mia-ai.net, 2026. https://mia-ai.net/ (เข้าถึง 26 ก.ย. 2026)

[3] Mia's AI Lab. "sparkDash, Multi-DGX Spark Monitoring Dashboard." GitHub, 2026. https://github.com/MiaAI-Lab/sparkDash (เข้าถึง 26 ก.ย. 2026)

[4] Mia's AI Lab. "Qwen3.8-27B on 16-32 GB Nvidia GPUs one-click install for Windows / Linux." GitHub, 2026. https://github.com/MiaAI-Lab/Qwen3.8-27B-16gb-NVIDIA-GPUs-one-click-install (เข้าถึง 26 ก.ย. 2026)

[5] NVIDIA. "DGX Spark specifications." nvidia.com, 2026. https://www.nvidia.com/en-us/products/workstations/dgx-spark/ (เข้าถึง 26 ก.ย. 2026)

[6] NVIDIA Developer Forums (@MiaAI_lab). "New Qwen3.8-Flash-Next NVFP4 recipe for 1× DGX Spark: 1M context, vision/video, 37 tok/s C1" (ความเห็น #5 และ #6). forums.developer.nvidia.com, 5 กันยายน 2026. https://forums.developer.nvidia.com/t/miaai-lab-new-qwen3-8-flash-next-nvfp4-recipe-for-1x-dgx-spark-1m-context-vision-video-37-tok-s-c1/382446

[7] NVIDIA Developer Forums. "DeepSeek v4 Flash (Aiden Recipe from Reddit): 1M token session operational" (ความเห็น #86, #87 และ #92). forums.developer.nvidia.com, 13-14 มิถุนายน 2026. https://forums.developer.nvidia.com/t/deepseek-v4-flash-aiden-recipe-from-reddit-1m-token-session-operational-cuda-12-1-tailored-for-dgx-spark-gb10/372268

Top comments (0)