DEV Community

BeanBean
BeanBean

Posted on Originally published at nextfuture.io.vn

Cần RAM/VRAM bao nhiêu để chạy LLM local trên laptop?

Originally published on NextFuture

Bạn dán một đoạn log production vào ChatGPT rồi khựng lại: trong đó có API key và tên khách hàng. Hoặc bạn ngồi quán cà phê, Wi-Fi chập chờn, và cả vòng lặp dev phụ thuộc vào một request mạng. Chạy model ngay trên máy xử lý được cả hai vấn đề — bài này tóm tắt cấu hình tối thiểu và ranh giới nên giữ lại cloud.

Theo hướng dẫn mới của Wired, lợi ích chính của local LLM là "offline access and greater privacy, because you're not sending anything to the cloud for anyone else to analyze or review", kèm việc không trả subscription tháng và không đụng usage rate.

RAM là nút thắt, không phải CPU

Wired không đưa ra "minimum spec" chính thức, nhưng mốc bộ nhớ thì rất cụ thể: 8 GB RAM là mức tối thiểu, và ở mức đó bạn bị giới hạn cả kích thước model lẫn tốc độ. 16 GB tốt hơn, còn 32 GB trở lên mới chạy được các model lớn và nhanh nhất.

Với GPU rời, bài viết nói cần "plenty of VRAM on a dedicated GPU (anything above 8 GB will make a difference)" vì loại bộ nhớ này tối ưu cho tác vụ AI. Trên Windows, GPU Nvidia rời giúp đáng kể. Wired cũng lưu ý macOS là nền tảng được dân AI ưa dùng hơn, vì chip Apple Silicon gộp CPU, GPU và RAM lại với nhau — kiến trúc mà model thích.

Chọn app và nguồn model

Wired xếp LM Studio Bionic là lựa chọn app tốt nhất trên Windows và macOS, miễn phí. Các lựa chọn phổ biến khác gồm vLLM, Llama.cpp, Ollama và GPT4All — đa nền tảng nhưng "a little more technical and involved". Kho model được nhắc đến nhiều nhất là Hugging Face, với hơn 3 triệu model để tải.

Hai đánh đổi cần biết trước khi bỏ buổi tối ra cài: model tải free "tend not to be as advanced or as speedy" so với LLM trong các app trả phí, dù đủ dùng hằng ngày; và bạn tự chịu phần bảo trì, kể cả tự cập nhật. Nếu cần đọc ảnh và tài liệu, tìm model multimodal thay vì model text thuần.

Local hay cloud: định tuyến theo từng request

Một bài trên Dev.to đề xuất coi local là mặc định và cloud là bước cuối, định tuyến theo ba tiêu chí: độ chịu đựng latency, độ nhạy cảm của dữ liệu, và concurrency. Tác giả lập luận local thắng ở latency và ở secret — prompt thường chứa dữ liệu người dùng, code nội bộ hoặc API key — và vẫn chạy khi mất mạng.

Chiều ngược lại cũng là lập luận của tác giả đó: server thắng khi máy bạn tắt (batch chạy qua đêm), khi cần concurrency (theo tác giả, laptop kham được hai call song song còn hosted worker kham hàng chục), và khi cả team cần một endpoint chung. Con số "nearly free" trong bài là tuyên bố của tác giả, không phải phép đo bạn nên copy.

Mẫu triển khai họ mô tả rất gọn: thử tiến trình local trước, bắt exception, rồi fallback sang endpoint remote — timeout và biên exception chính là điểm ra quyết định. Đây là ví dụ minh hoạ, không phải kiến trúc bắt buộc.

Bắt đầu thế nào

Kiểm tra RAM máy trước tiên: dưới 16 GB thì đặt kỳ vọng ở model nhỏ. Cài LM Studio Bionic, tải một model nhỏ trong model picker, rồi đo trên chính workload của bạn — tác giả Dev.to nói thẳng rằng một benchmark tự chạy cho biết nhiều hơn bất kỳ bài blog nào. Giữ cloud cho batch qua đêm, cho concurrency cao và cho các tác vụ cần model mạnh nhất.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)