DEV Community

BeanBean
BeanBean

Posted on • Originally published at nextfuture.io.vn

Meta mở mã Muse Glimmer: AI 30 tỷ tham số chạy trên PC

Originally published on NextFuture

Zuckerberg vừa công bố Meta sẽ mở mã Muse Glimmer, mô hình 30 tỷ tham số đủ nhỏ để chạy trên một GPU tiêu dùng, không cần server cloud. Đây là bước Meta rẽ hướng khỏi mô hình subscription mà OpenAI và Anthropic đang theo đuổi.

Muse Glimmer: AI luôn bật, chạy ngay trên máy của bạn

Trong bài luận 6.510 từ công bố ngày 10/8, Zuckerberg mô tả Muse Glimmer là model "small enough to run on a Mac or PC with a single consumer GPU" — đủ nhỏ để chạy trên Mac hoặc PC chỉ với một GPU tiêu dùng. Khác với chatbot cloud, model này được thiết kế cho agent cá nhân chạy liên tục (always-on agent), học ngữ cảnh người dùng theo thời gian thực thay vì chờ bạn mở app mỗi lần.

Zuckerberg viết trong bài luận: "We will offer free versions that will be accessible to billions of people." Chiến lược mở mã ở đây lặp lại playbook Llama trước đó, nhưng lần này nhắm thẳng vào personal agent thay vì LLM đa dụng dùng cho chatbot.

Vì sao đây là canh bạc hạ tầng, không chỉ marketing

Khác với chatbot cloud phụ thuộc API và subscription, một agent local luôn bật có thể trở thành nền tảng mặc định trên thiết bị — ai kiểm soát runtime chạy AI trên máy người dùng sẽ kiểm soát luôn hệ sinh thái ứng dụng AI cá nhân tiếp theo, tương tự cách hệ điều hành từng khoá người dùng vào một nền tảng. Đây là lý do đáng để dev VN theo dõi từ bây giờ, không cần đợi Meta ra sản phẩm chính thức mới quan tâm.

Tự host LLM local ngay hôm nay: 3 lựa chọn chi phí

Bạn không cần chờ Muse Glimmer để trải nghiệm hướng đi tương tự. Với Open WebUI (hơn 70.000 sao GitHub) chạy cùng Ollama trên Docker, bạn có thể tự host các model quantized như Llama 3.1, Mistral NeMo, DeepSeek-Coder hay Qwen 2.5 trên một VPS giá rẻ, giữ toàn bộ prompt và code ở lại máy chủ của mình.

Phương ánChi phí/thángGiới hạn

ChatGPT Plus / Claude Pro*$20* (~$240/năm)Rate limit giờ cao điểm, dữ liệu bị giữ lại để train
Open WebUI + Ollama (VPS riêng)$6–12Không giới hạn tin nhắn, 100% riêng tư
Hybrid (Open WebUI + OpenRouter/DeepSeek API)$1–3 (trả theo token)Truy cập 100+ model qua một giao diện

Đây là ước tính chi phí lấy từ hướng dẫn tự host gốc, không phải số liệu chính thức từ nhà cung cấp VPS — chi phí thực tế còn tùy cấu hình RAM/NVMe và lượng token bạn dùng mỗi tháng.

Việc cần theo dõi tiếp

  • Meta có phát hành Muse Glimmer công khai kèm license cụ thể, hay chỉ dừng ở bài luận, trong vài tuần tới.

  • Nếu bạn đang trả subscription AI hàng tháng, hãy benchmark tốc độ token trên VPS 8GB RAM với llama3.1:8b trước khi quyết định chuyển hẳn sang self-host.

  • Theo dõi xem OpenAI và Anthropic có tung gói on-device riêng để phản ứng lại chiến lược này của Meta hay không.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)