DEV Community

BeanBean
BeanBean

Posted on • Originally published at nextfuture.io.vn

Tự Host LLM Bằng Open WebUI + Docker: Rẻ Hơn ChatGPT Plus?

Originally published on NextFuture

Mỗi tháng bạn trả 20 đô cho ChatGPT Plus hoặc Claude Pro, tức khoảng 240 đô một năm — mà vẫn dính rate limit vào giờ cao điểm, dữ liệu prompt bị bên thứ ba giữ lại, và không hề có quyền quyết định khi nào model bị deprecate. Một hướng đi khác: tự host model open-weight bằng Open WebUI và Ollama trên một VPS giá rẻ, chạy hoàn toàn riêng tư.

Chi phí thực tế: tự host rẻ hơn bao nhiêu

Theo một hướng dẫn tự host gần đây, một VPS chạy Open WebUI + Ollama tốn khoảng 6-12 đô/tháng, dữ liệu 100% riêng tư và không giới hạn số tin nhắn. Nếu kết hợp thêm API trả theo token (OpenRouter, DeepSeek) cho các tác vụ nặng, chi phí chỉ khoảng 1-3 đô/tháng tuỳ mức dùng, đổi lại được truy cập hơn 100 model qua một giao diện thống nhất. Một VPS tham khảo cụ thể: Hetzner Cloud CX32 — 4 vCPU, 8GB RAM, 80GB NVMe — giá khoảng 7,59 EUR/tháng.

Hướng dẫn này còn cho biết việc trộn model local (miễn phí) với API frontier ở mức khoảng 0,002 đô/prompt có thể giúp tiết kiệm tới khoảng 90% ngân sách AI — đây là con số do tác giả hướng dẫn tự tính, nên xem là ước tính tham khảo chứ không phải benchmark độc lập.

Open WebUI là gì và vì sao được chọn

💡 Gợi ý tool: Nếu bạn đang triển khai tương tự, DigitalOcean — Simple VPS & cloud hosting. $200 credit for new users over 60 days..

Open WebUI hiện có hơn 70.000 star trên GitHub, được mô tả là một trong những giao diện AI mã nguồn mở hoàn thiện nhất hiện nay: đầy đủ lịch sử chat, markdown, RAG tích hợp để chat trực tiếp với tài liệu PDF hoặc codebase, và phân quyền multi-user để cả team dùng chung mà không phải trả phí theo đầu người.

Setup tối giản bằng Docker Compose

Stack gồm hai service: ghcr.io/open-webui/open-webui:main nối tới ollama/ollama:latest qua biến môi trường OLLAMA_BASE_URL, expose port 3000 ra ngoài. Sau khi docker compose up -d, bạn pull model ngay trong container Ollama — ví dụ qwen2.5-coder:7b cho coding, llama3.1:8b cho reasoning tổng quát, hoặc llama3.2:3b nếu VPS cấu hình thấp. Bước cuối là gắn reverse proxy (Caddy) để có HTTPS tự động cho domain riêng.

Có đáng để chuyển sang không

Nếu bạn hoặc team đã quen trả subscription hàng tháng cho một trợ lý AI, phép so sánh chi phí ở trên đáng để thử nghiệm trên một VPS nhỏ trước khi cam kết toàn bộ. Rủi ro chính không nằm ở tiền mà ở việc tự vận hành: bạn chịu trách nhiệm update, bảo mật, và chất lượng model open-weight vẫn còn khoảng cách với các model đóng hàng đầu cho việc code phức tạp.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)