DEV Community

Review Laptop
Review Laptop

Posted on • Originally published at reviewlaptop.vn

iGPU VRAM Ceiling: Laptop Mỏng Nhẹ Chạy Được LLM Local Nào?

Nhiều người hí hửng sắm laptop mỏng nhẹ gắn mác "AI PC" đời mới như ThinkPad X1 Carbon Gen 13 hay Yoga Slim 7, hy vọng chạy LLM cục bộ mượt mà, để rồi vỡ mộng khi máy giật lag hoặc báo lỗi tràn bộ nhớ. Sự thật là, quảng cáo thì kêu nhưng thực tế dùng AI local trên iGPU lại vấp phải một bức tường lớn: giới hạn VRAM (iGPU VRAM ceiling).

Giới hạn thực tế: UMA và bài toán chia đôi RAM

Không giống card rời (dGPU), iGPU trên các dòng CPU Intel hay Snapdragon phải chia sẻ bộ nhớ với RAM hệ thống (UMA). Trên hệ điều hành, VRAM khả dụng tối đa cho iGPU thường chỉ bằng 50% tổng dung lượng RAM vật lý.

  • Với máy 16GB RAM: iGPU chỉ chạm trần tối đa ~8GB VRAM. Sau khi trừ đi dung lượng cho hệ điều hành và các app chạy ngầm, bạn chỉ còn khoảng 2-3GB VRAM "sạch" cho LLM.
  • Với máy 32GB RAM: Bạn có tối đa 16GB VRAM, đủ không gian cho các model trung bình.

Theo phân tích cấu hình thực tế từ trang ReviewLaptop, các mẫu máy tối ưu như ThinkPad X1 Carbon Gen 13 (2025) hay Dell Latitude 7350 tối ưu pin rất tốt, nhưng nếu chỉ mua bản 16GB RAM mặc định, bạn sẽ tự sát về mặt hiệu năng AI.

Phân tích theo tác vụ và cấu hình chạy Ollama / LM Studio

Đừng để các con số benchmark phóng đại đánh lừa. Thực tế trải nghiệm local LLM trên iGPU được chia làm hai phân khúc rõ rệt theo tác vụ:

1. Tác vụ cơ bản (Chat, tóm tắt bằng model <8B):
Chạy tốt ở mức quantization Q4 hoặc Q5. Đo thực tế dòng chip mới đạt ngưỡng tốc độ từ 10 - 25 TPS tùy dòng chip và context length. Hãy mở terminal và chạy:

# Chạy model Llama 3 8B bản Q4_K_M
ollama run llama3:8b-instruct-q4_K_M

# Hoặc bản Q5_K_M nặng hơn chút
ollama run llama3:8b-instruct-q5_K_M
Enter fullscreen mode Exit fullscreen mode

Để kiểm tra xem model đã nạp hoàn toàn vào GPU chưa, hãy mở tab terminal khác gõ:

ollama ps
Enter fullscreen mode Exit fullscreen mode

Trong LM Studio, hãy tìm mục GPU Offload, kéo slider lên mức tối đa để nạp các layers vào iGPU. Nhưng nói thẳng, nếu máy chỉ có 16GB RAM, khi chạy bản Q8 bằng lệnh:

ollama run llama3:8b-instruct-q8_0
Enter fullscreen mode Exit fullscreen mode

Hệ thống sẽ bị tràn VRAM, buộc phải đẩy một phần tính toán sang CPU, khiến tốc độ tụt thê thảm xuống dưới 2-3 TPS.

2. Tác vụ phức tạp (Coding, lý luận sâu với model >14B):
Các model lớn như Llama3-70B hoàn toàn không thể chạy khả thi trên iGPU này. Lý do đơn giản: kích thước file model vượt quá trần VRAM, buộc máy phải chạy CPU fallback hoàn toàn, gây nghẽn cổ chai băng thông và giật lag cực độ.

Verdict:
Được và mất rõ ràng: laptop mỏng nhẹ giúp bạn di động, nhưng để làm AI local, nguyên tắc tối thượng là phải chọn phiên bản 32GB RAM. Bạn có chấp nhận đánh đổi hiệu năng AI để lấy sự mỏng nhẹ, hay sẽ chọn giải pháp Cloud API để đỡ đau đầu?

Canonical URL: https://www.reviewlaptop.vn/laptop-mong-nhe-can-nang-va-pin/

Top comments (0)