จูน Ollama ให้เร็วขึ้น 2026, 5 ค่าที่ควรตั้งก่อนใช้โมเดลท้องถิ่นจริงจัง
โดย Nokka (นก-กา) | 11 กันยายน 2026
บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka
คนที่ติดตั้ง Ollama แล้วมักเจอปัญหาเดียวกันคือโมเดลตอบช้ากว่าที่คาด ทั้งที่เครื่องมีสเปกดี
สาเหตุส่วนใหญ่ไม่ได้อยู่ที่ฮาร์ดแวร์ แต่อยู่ที่ค่าตั้งต้นของ Ollama ที่ไม่ได้ปรับมาสำหรับการใช้งานหนัก [1]
ค่าที่หนึ่ง: Flash Attention
Flash Attention เป็นเทคนิคที่ทำให้การคำนวณความสนใจในโมเดลเร็วขึ้น โดยเก็บข้อมูลไว้ในแคชของการ์ดจอแทนหน่วยความจำหลัก [2]
หลายคนเข้าใจผิดว่าค่าตั้งต้นปิดไว้ จริง ๆ แล้ว Ollama เปิดใช้ฟีเจอร์นี้อัตโนมัติเมื่อระบบรองรับ [3]
ตัวแปรสภาพแวดล้อมที่กำหนดจึงมีไว้เพื่อบังคับเปิด ในกรณีที่ระบบตรวจไม่พบเองหรือต้องการบังคับให้แน่นอน [2][3]
ผลที่ได้คือทั้งความเร็วและคุณภาพในงานที่ใช้บริบทยาว เพราะเทคนิคนี้จัดการหน่วยความจำได้มีประสิทธิภาพกว่า
ค่าที่สอง: ชนิดของแคช KV
ค่า KV Cache Type กำหนดว่าระบบเก็บข้อมูลปฐมภูมิของการคำนวณในรูปแบบใด [1]
เงื่อนไขสำคัญคือการบีบอัดค่านี้ทำได้เมื่อเปิด Flash Attention แล้วเท่านั้น ถ้ายังไม่เปิด ตัวเลือกนี้จะไม่มีผล [3]
การเลือกใช้รูปแบบบีบอัดระดับหนึ่งสามารถเพิ่มความยาวบริบทที่รองรับได้ราวสองเท่าก่อนหน่วยความจำจะเต็ม เพราะข้อมูลกินพื้นที่น้อยลง
ต้องแลกกับความแม่นยำที่ลดลงเล็กน้อย ซึ่งในงานทั่วไปแทบไม่รู้สึก แต่ในงานที่ต้องการความแม่นยำสูงควรทดสอบเทียบก่อน
ค่าที่สาม: ความยาวบริบท
ค่าเริ่มต้นของความยาวบริบทมักตั้งไว้ต่ำ เพราะประหยัดหน่วยความจำ แต่ถ้าใช้งานกับเอกสารยาวหรือโค้ดขนาดใหญ่ จะไม่พอ [4]
การเพิ่มค่านี้ทำให้โมเดลจำบทสนทนายาวได้ แต่แลกกับหน่วยความจำที่ใช้มากขึ้นอย่างชัดเจน
แนวปฏิบัติที่ปลอดภัยคือเริ่มจากค่าที่พอดีกับงานจริง ไม่ต้องตั้งสูงสุด เพราะบริบทที่ใหญ่เกินจำเป็นทำให้ทุกคำตอบช้าลงทั้งหมด
ค่าที่สี่: จำนวนชั้นที่ส่งไปการ์ดจอ
ค่าตั้งต้นระบบจะจัดการเองว่าให้ชั้นใดของโมเดลทำงานบนการ์ดจอ [1]
ถ้าเครื่องมีแรมการ์ดจอจำกัด แต่ยังต้องการใช้โมเดลใหญ่ การกำหนดจำนวนชั้นที่ชัดเจนช่วยให้ใช้ทรัพยากรได้เต็มที่กว่า
วิธีนี้เรียกว่าการประมวลผลแบบผสม คือให้บางส่วนทำงานบนการ์ดจอและบางส่วนทำงานบนซีพียู ช้ากว่าแต่รันได้
ค่าที่ห้า: โหลดโมเดลล่วงหน้า
ทุกครั้งที่เรียกใช้ Ollama ครั้งแรก ระบบต้องโหลดโมเดลขึ้นหน่วยความจำก่อน ซึ่งกินเวลาหลายวินาทีถึงหลายสิบวินาที [3]
การโหลดโมเดลค้างไว้ล่วงหน้าด้วยคำสั่งที่ส่งข้อความว่าง ทำให้คำขอแรกตอบเร็วเท่ากับคำขอถัดไป
วิธีนี้เหมาะกับเครื่องที่มีหน่วยความจำเหลือเฟือ แต่ถ้าหน่วยความจำจำกัด การโหลดค้างหลายโมเดลจะทำให้ระบบช้าลงทั้งหมด
สรุปเป็นตาราง
| ค่า | ค่าตั้งต้น | ควรตั้งเป็น | แลกกับอะไร |
|---|---|---|---|
| Flash Attention | อัตโนมัติเมื่อรองรับ | บังคับเปิดได้ | แทบไม่มีข้อเสีย |
| KV Cache Type | f16 | q8_0 (ต้องเปิด FA ก่อน) | ความแม่นยำเล็กน้อย |
| num_ctx | ต่ำ | พอดีกับงาน | หน่วยความจำ |
| num_gpu | อัตโนมัติ | กำหนดเองเมื่อจำเป็น | ความซับซ้อนในการตั้ง |
| โหลดล่วงหน้า | ไม่ | ตามความจำเป็น | หน่วยความจำที่จองไว้ |
ข้อควรระวังก่อนปรับค่า
หนึ่ง การเปิด Flash Attention ได้ผลต่างกันตามการ์ดจอ มีรายงานว่าบางรุ่นกลับช้าลงอย่างมีนัยสำคัญ [1] ควรวัดผลก่อนและหลังด้วยงานจริงของตัวเอง
สอง การบีบอัดแคช KV ทำให้ความแม่นยำลดลงในงานที่ต้องใช้บริบทแม่นยำสูง เช่นการวิเคราะห์ตัวเลขหรือการอ่านเอกสารกฎหมาย
สาม ค่าที่ดีที่สุดของแต่ละเครื่องไม่เหมือนกัน การลอกค่าจากคนอื่นโดยไม่วัดของตัวเองเป็นวิธีที่ได้ผลไม่แน่นอน
สี่ ตัวเลขความเร็วที่โฆษณากันมักวัดจากเครื่องเปล่า ถ้าเครื่องของคุณมีโปรแกรมอื่นรันอยู่ด้วย ผลจริงจะต่ำกว่านั้น
มุมมองจากคนที่จูนเครื่องตัวเองมาแล้ว
ผมใช้ Ollama รันโมเดลบนเครื่องตัวเอง และบทเรียนที่ชัดที่สุดคือการวัดผลต้องทำอย่างเป็นระบบ
ช่วงแรกผมปรับค่าหลายอย่างพร้อมกัน แล้วพบว่าเร็วขึ้นจริง แต่ไม่รู้ว่าค่าไหนที่ช่วย การเปลี่ยนทีละค่าพร้อมจดบันทึกให้คำตอบที่ใช้ต่อได้จริง
อีกเรื่องที่ผมพบคือ Flash Attention เป็นค่าที่ให้ผลดีที่สุดอย่างไม่ต้องคิดมากสำหรับคนที่มีการ์ดจอ NVIDIA รุ่นใหม่ เพราะเป็นเทคนิคที่ออกแบบมาเพื่อจัดการหน่วยความจำโดยตรง
คำแนะนำของผมคือเริ่มจากสองค่าที่ปลอดภัยที่สุดก่อน คือเปิด Flash Attention กับเพิ่มความยาวบริบทให้พอดีงาน แล้ววัดผล ถ้ายังไม่พอค่อยลองค่าที่แลกความแม่นยำ
แหล่งอ้างอิง
[1] Khatik, K., "Optimizing Ollama Performance on Windows: Hardware, Quantization, Parallelism & More", Medium (2026), https://medium.com/@kapildevkhatik2/optimizing-ollama-performance-on-windows-hardware-quantization-parallelism-more-fac04802288e
[2] Broadcom TechDocs, "Understanding the Ollama provider" (2026), https://techdocs.broadcom.com/us/en/vmware-tanzu/platform/ai-services/10-0/ai/explanation-understanding-ollama-configuration.html
[3] Ollama, "FAQ" (เข้าถึง 11 ก.ย. 2026), https://docs.ollama.com/faq
[4] Easton Dev, "Ollama Performance Tuning: Batching, KV Cache, and OOM" (2026), https://eastondev.com/blog/en/posts/ai/20260410-ollama-performance-optimization/
Top comments (0)