DEV Community

Nokka
Nokka

Posted on

จูน Ollama ให้เร็วขึ้น 2026, 5 ค่าที่ควรตั้งก่อนใช้โมเดลท้องถิ่นจริงจัง

จูน Ollama ให้เร็วขึ้น 2026, 5 ค่าที่ควรตั้งก่อนใช้โมเดลท้องถิ่นจริงจัง

โดย Nokka (นก-กา) | 11 กันยายน 2026

บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka

คนที่ติดตั้ง Ollama แล้วมักเจอปัญหาเดียวกันคือโมเดลตอบช้ากว่าที่คาด ทั้งที่เครื่องมีสเปกดี

สาเหตุส่วนใหญ่ไม่ได้อยู่ที่ฮาร์ดแวร์ แต่อยู่ที่ค่าตั้งต้นของ Ollama ที่ไม่ได้ปรับมาสำหรับการใช้งานหนัก [1]

ค่าที่หนึ่ง: Flash Attention

Flash Attention เป็นเทคนิคที่ทำให้การคำนวณความสนใจในโมเดลเร็วขึ้น โดยเก็บข้อมูลไว้ในแคชของการ์ดจอแทนหน่วยความจำหลัก [2]

หลายคนเข้าใจผิดว่าค่าตั้งต้นปิดไว้ จริง ๆ แล้ว Ollama เปิดใช้ฟีเจอร์นี้อัตโนมัติเมื่อระบบรองรับ [3]

ตัวแปรสภาพแวดล้อมที่กำหนดจึงมีไว้เพื่อบังคับเปิด ในกรณีที่ระบบตรวจไม่พบเองหรือต้องการบังคับให้แน่นอน [2][3]

ผลที่ได้คือทั้งความเร็วและคุณภาพในงานที่ใช้บริบทยาว เพราะเทคนิคนี้จัดการหน่วยความจำได้มีประสิทธิภาพกว่า

ค่าที่สอง: ชนิดของแคช KV

ค่า KV Cache Type กำหนดว่าระบบเก็บข้อมูลปฐมภูมิของการคำนวณในรูปแบบใด [1]

เงื่อนไขสำคัญคือการบีบอัดค่านี้ทำได้เมื่อเปิด Flash Attention แล้วเท่านั้น ถ้ายังไม่เปิด ตัวเลือกนี้จะไม่มีผล [3]

การเลือกใช้รูปแบบบีบอัดระดับหนึ่งสามารถเพิ่มความยาวบริบทที่รองรับได้ราวสองเท่าก่อนหน่วยความจำจะเต็ม เพราะข้อมูลกินพื้นที่น้อยลง

ต้องแลกกับความแม่นยำที่ลดลงเล็กน้อย ซึ่งในงานทั่วไปแทบไม่รู้สึก แต่ในงานที่ต้องการความแม่นยำสูงควรทดสอบเทียบก่อน

ค่าที่สาม: ความยาวบริบท

ค่าเริ่มต้นของความยาวบริบทมักตั้งไว้ต่ำ เพราะประหยัดหน่วยความจำ แต่ถ้าใช้งานกับเอกสารยาวหรือโค้ดขนาดใหญ่ จะไม่พอ [4]

การเพิ่มค่านี้ทำให้โมเดลจำบทสนทนายาวได้ แต่แลกกับหน่วยความจำที่ใช้มากขึ้นอย่างชัดเจน

แนวปฏิบัติที่ปลอดภัยคือเริ่มจากค่าที่พอดีกับงานจริง ไม่ต้องตั้งสูงสุด เพราะบริบทที่ใหญ่เกินจำเป็นทำให้ทุกคำตอบช้าลงทั้งหมด

ค่าที่สี่: จำนวนชั้นที่ส่งไปการ์ดจอ

ค่าตั้งต้นระบบจะจัดการเองว่าให้ชั้นใดของโมเดลทำงานบนการ์ดจอ [1]

ถ้าเครื่องมีแรมการ์ดจอจำกัด แต่ยังต้องการใช้โมเดลใหญ่ การกำหนดจำนวนชั้นที่ชัดเจนช่วยให้ใช้ทรัพยากรได้เต็มที่กว่า

วิธีนี้เรียกว่าการประมวลผลแบบผสม คือให้บางส่วนทำงานบนการ์ดจอและบางส่วนทำงานบนซีพียู ช้ากว่าแต่รันได้

ค่าที่ห้า: โหลดโมเดลล่วงหน้า

ทุกครั้งที่เรียกใช้ Ollama ครั้งแรก ระบบต้องโหลดโมเดลขึ้นหน่วยความจำก่อน ซึ่งกินเวลาหลายวินาทีถึงหลายสิบวินาที [3]

การโหลดโมเดลค้างไว้ล่วงหน้าด้วยคำสั่งที่ส่งข้อความว่าง ทำให้คำขอแรกตอบเร็วเท่ากับคำขอถัดไป

วิธีนี้เหมาะกับเครื่องที่มีหน่วยความจำเหลือเฟือ แต่ถ้าหน่วยความจำจำกัด การโหลดค้างหลายโมเดลจะทำให้ระบบช้าลงทั้งหมด

สรุปเป็นตาราง

ค่า ค่าตั้งต้น ควรตั้งเป็น แลกกับอะไร
Flash Attention อัตโนมัติเมื่อรองรับ บังคับเปิดได้ แทบไม่มีข้อเสีย
KV Cache Type f16 q8_0 (ต้องเปิด FA ก่อน) ความแม่นยำเล็กน้อย
num_ctx ต่ำ พอดีกับงาน หน่วยความจำ
num_gpu อัตโนมัติ กำหนดเองเมื่อจำเป็น ความซับซ้อนในการตั้ง
โหลดล่วงหน้า ไม่ ตามความจำเป็น หน่วยความจำที่จองไว้

ข้อควรระวังก่อนปรับค่า

หนึ่ง การเปิด Flash Attention ได้ผลต่างกันตามการ์ดจอ มีรายงานว่าบางรุ่นกลับช้าลงอย่างมีนัยสำคัญ [1] ควรวัดผลก่อนและหลังด้วยงานจริงของตัวเอง

สอง การบีบอัดแคช KV ทำให้ความแม่นยำลดลงในงานที่ต้องใช้บริบทแม่นยำสูง เช่นการวิเคราะห์ตัวเลขหรือการอ่านเอกสารกฎหมาย

สาม ค่าที่ดีที่สุดของแต่ละเครื่องไม่เหมือนกัน การลอกค่าจากคนอื่นโดยไม่วัดของตัวเองเป็นวิธีที่ได้ผลไม่แน่นอน

สี่ ตัวเลขความเร็วที่โฆษณากันมักวัดจากเครื่องเปล่า ถ้าเครื่องของคุณมีโปรแกรมอื่นรันอยู่ด้วย ผลจริงจะต่ำกว่านั้น

มุมมองจากคนที่จูนเครื่องตัวเองมาแล้ว

ผมใช้ Ollama รันโมเดลบนเครื่องตัวเอง และบทเรียนที่ชัดที่สุดคือการวัดผลต้องทำอย่างเป็นระบบ

ช่วงแรกผมปรับค่าหลายอย่างพร้อมกัน แล้วพบว่าเร็วขึ้นจริง แต่ไม่รู้ว่าค่าไหนที่ช่วย การเปลี่ยนทีละค่าพร้อมจดบันทึกให้คำตอบที่ใช้ต่อได้จริง

อีกเรื่องที่ผมพบคือ Flash Attention เป็นค่าที่ให้ผลดีที่สุดอย่างไม่ต้องคิดมากสำหรับคนที่มีการ์ดจอ NVIDIA รุ่นใหม่ เพราะเป็นเทคนิคที่ออกแบบมาเพื่อจัดการหน่วยความจำโดยตรง

คำแนะนำของผมคือเริ่มจากสองค่าที่ปลอดภัยที่สุดก่อน คือเปิด Flash Attention กับเพิ่มความยาวบริบทให้พอดีงาน แล้ววัดผล ถ้ายังไม่พอค่อยลองค่าที่แลกความแม่นยำ

แหล่งอ้างอิง

[1] Khatik, K., "Optimizing Ollama Performance on Windows: Hardware, Quantization, Parallelism & More", Medium (2026), https://medium.com/@kapildevkhatik2/optimizing-ollama-performance-on-windows-hardware-quantization-parallelism-more-fac04802288e

[2] Broadcom TechDocs, "Understanding the Ollama provider" (2026), https://techdocs.broadcom.com/us/en/vmware-tanzu/platform/ai-services/10-0/ai/explanation-understanding-ollama-configuration.html

[3] Ollama, "FAQ" (เข้าถึง 11 ก.ย. 2026), https://docs.ollama.com/faq

[4] Easton Dev, "Ollama Performance Tuning: Batching, KV Cache, and OOM" (2026), https://eastondev.com/blog/en/posts/ai/20260410-ollama-performance-optimization/

Top comments (0)