Bài viết này là bản tóm tắt kỹ thuật về giới hạn phần cứng khi chạy LLM nội bộ. Canonical URL trỏ về bài đánh giá gốc tại ReviewLaptop.
Ultrabook sử dụng chip dòng U tiết kiệm điện như Core i5-1345U thường được định vị cho các tác vụ văn phòng tinh gọn, bền bỉ. Tuy nhiên, việc cố gắng biến dòng máy này thành một trạm chạy LLM (Large Language Model) cục bộ lại là câu chuyện hoàn toàn khác. Thực tế thì, đừng để những thuật ngữ tiếp thị về "AI PC" đánh lừa bạn. Với giới hạn điện năng TDP chỉ 15W và không có GPU rời, rào cản lớn nhất không phải là sức mạnh CPU mà chính là giới hạn (ceiling) VRAM của iGPU.
Giới hạn iGPU VRAM thực tế trên cấu hình i5-1345U 16GB
Core i5-1345U sở hữu cấu hình 10 nhân và 12 luồng (đạt điểm Cinebench R23 là 1724 đơn nhân / 7724 đa nhân; Geekbench 6 đạt 2338 đơn nhân / 8245 đa nhân theo dữ liệu từ NotebookCheck). Khi ghép đôi với 16GB RAM hệ thống, Windows 11 mặc định chỉ chia sẻ tối đa 50% RAM làm VRAM cho iGPU Intel Iris Xe (khoảng 8GB).
Trừ đi dung lượng RAM cho hệ điều hành và các ứng dụng chạy ngầm (ví dụ như bộ công cụ PowerToys chiếm khoảng 210 - 280 MB RAM lúc chờ), dung lượng khả dụng thực tế để nạp model chỉ còn khoảng 5 - 6GB. Để tối ưu hóa tài nguyên trên LM Studio hoặc Ollama, bạn buộc phải giới hạn độ dài ngữ cảnh (context length ở mức 2048 hoặc 4096 tokens) và sử dụng mức quantization phù hợp. Nếu cố nạp các model lớn, máy sẽ bị tràn bộ nhớ và sụt giảm hiệu năng nghiêm trọng do phân trang (swap) liên tục xuống SSD PCIe 4.0.
Cấu hình Ollama và LM Studio để tránh chạm trần VRAM
Để chạy LLM cục bộ hiệu quả trên cấu hình này, bạn nên chọn các mô hình nhỏ như Llama 3 8B ở định dạng Q4 hoặc Q5. Tránh xa các phiên bản Q8 hoặc FP16 vì chúng sẽ lập tức làm cạn kiệt RAM.
Chạy bản nén Q4 (mượt nhất):
ollama run llama3:8b-instruct-q4_K_M
Chạy bản nén Q5:
ollama run llama3:8b-instruct-q5_K_M
Chạy bản nén Q8 (nặng, dễ nghẽn):
ollama run llama3:8b-instruct-q8_0
Giám sát lượng VRAM được phân bổ bằng lệnh:
ollama ps
Trong LM Studio, tại phần Hardware Settings, bạn cần kích hoạt GPU Offload nhưng chỉ nên set số lượng layer (layers offloaded) ở mức vừa phải (khoảng 10-15 layers đối với model 8B) để chia sẻ bớt gánh nặng sang CPU, tránh làm sập driver đồ họa của iGPU khi bộ nhớ chia sẻ chạm ngưỡng trần. Tốc độ xử lý (TPS) của dòng chip này chỉ ở mức cơ bản, ngưỡng chung từ 8 - 12 TPS với model 3B Q4, và tụt xuống còn 2 - 4 TPS với model 8B Q5.
Verdict: Được và mất
Nói thẳng ra, ultrabook i5-1345U không được thiết kế để gánh tác vụ AI nặng. Các model từ 13B tham số trở lên hoàn toàn không chạy được trên cấu hình này do dung lượng bộ nhớ khả dụng quá nhỏ để chứa các file tensor lớn, dẫn đến crash ứng dụng ngay khi khởi chạy.
- Ai nên dùng: Lập trình viên cần test prompt nhanh hoặc chạy thử các model tí hon (1.5B - 3B) cho các tác vụ xử lý văn bản đơn giản.
- Ai nên tránh: Người cần chạy các mô hình lớn (13B trở lên), đòi hỏi tốc độ phản hồi nhanh (TPS cao) hoặc cần xử lý tài liệu với context window lớn.
Top comments (0)