DEV Community

BeanBean
BeanBean

Posted on Originally published at nextfuture.io.vn

Mac M5 Ultra 512GB: khi nào chạy LLM local rẻ hơn cloud?

Originally published on NextFuture

Bạn trả tiền per-token cho agent chạy cả ngày, và hóa đơn tháng sau luôn cao hơn tháng trước. Thử kéo model 70B về máy thì nó swap ra disk, token nhả chậm tới mức không dùng nổi.

Apple vừa công bố M6 và M5 Ultra. Dưới đây là con số thật từ đợt ra mắt, cùng khung để bạn tự quyết định local hay cloud.

Apple đưa ra những con số nào

M5 Ultra là thiết kế quad-die: hai die M5 Max nối qua UltraFusion interconnect bản nâng cấp, lên tới 36-core CPU, 80-core GPU và 512GB unified memory ở 1.2TB/s. Bản tin nguồn ghi đây là mức tăng 50% memory bandwidth so với M3 Ultra.

M6 là chip 2nm đầu tiên của Apple: 12-core CPU với hai "super core" mới và 16-core Neural Engine. Cả M5 lẫn M6 đều có neural accelerator trong mọi GPU core — hardware matmul nằm thẳng trong graphics pipeline.

Apple tự công bố mức "up to 4x faster AI performance" và "13.5x faster LLM prompt processing" so với thế hệ M1. Đây là số của Apple, chưa phải benchmark độc lập — nguồn nói thẳng: "Benchmarks will tell the real story in a couple of weeks." Đừng đưa hai con số này vào bài toán chi phí của bạn.

512GB mới là biến số, không phải Neural Engine

Nguồn mô tả khác biệt rất cụ thể: 512GB là "the difference between running a 70B model comfortably with a long context window, versus swapping to disk". Điều này khớp với thực tế vận hành: dung lượng memory quyết định bạn có load nổi model hay không, còn bandwidth quyết định tốc độ nhả token. Số core Neural Engine không cứu nổi model không nằm vừa RAM.

Với team ở VN, có một biến số nữa không quy ra tiền cloud được: dữ liệu không rời khỏi máy.

Checklist trước khi chuyển workload sang local

  • Chọn model theo loại input, đừng chọn theo cảm giác lúc chat. Một hướng dẫn setup local nhắc rõ: nếu tác vụ phụ thuộc screenshot, scan hay page preview thì phải dùng vision-capable model, vì "a text-only model is not a substitute simply because it produces good answers in chat".

  • Kiểm tra memory và disk requirement của model trước khi pull, đừng chỉ nhìn tên model.

  • Server chạy không có nghĩa là pipeline chạy đúng. Cùng nguồn đó: "A successful connection means the server is reachable. You still need to check whether the model can read your files and produce useful names."

  • Test đúng loại file bạn thật sự nhận. Nguồn viết: "The file extension alone does not establish that a given model and application pipeline can interpret its contents well."

  • Hướng dẫn đó liệt kê qwen2.5vl:3b như một lựa chọn khởi đầu, và nói rõ đây chỉ là ví dụ setup, không phải model tốt nhất cho mọi máy.

Khung quyết định

Chi phí nằm ở pattern sử dụng chứ không ở spec. Chiếu workload của bạn vào ba nhóm:

  • Agent chạy nền cả ngày, prompt lặp lại, context dài → local có lợi thế vì không tính tiền theo token.

  • Tải theo đợt, vài giờ mỗi tuần → phần cứng nằm không phần lớn thời gian, cloud vẫn hợp lý hơn.

  • Model bạn cần không nằm vừa RAM hiện có → đây mới là lý do nâng cấp, không phải mấy con số "nhanh hơn x lần".

Nguồn cũng cảnh báo giá là điểm nghẽn: "A maxed-out Mac Studio won't be cheap, and most people don't need 512GB" — nhưng theo họ, với nhóm làm local inference nghiêm túc (Mistral, FLUX, Gemma), đây là lần đầu một desktop box trông giống lựa chọn thay thế thật cho GPU rental.

Việc cần làm tiếp

Đo lại hóa đơn token 30 ngày gần nhất, tách agent chạy nền khỏi phần tương tác trực tiếp — hai nhóm này có kinh tế học khác hẳn nhau. Chờ benchmark độc lập rồi mới so tốc độ prompt processing. Trong lúc chờ, thử chính model bạn định chạy ở mức quantize thấp hơn trên máy hiện có, để biết pipeline có sống nổi trước khi bàn chuyện mua máy.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)