Originally published on NextFuture
Bạn trả $49.99/tháng cho Colab Pro, nhưng phần lớn compute unit cháy vì quên tắt session. Trên đúng chiếc máy đó, bạn còn trả thêm cho Cursor, Copilot hoặc Windsurf. Hai bài đo chi phí vừa đăng trên Dev.to cho đủ số liệu để bạn tính lại điểm hoà vốn trước kỳ gia hạn tới.
Tiền Colab Pro chảy đi đâu
Tác giả của cả hai bài — cùng một developer — công bố usage của chính mình giai đoạn tháng 1 đến tháng 8/2026: khoảng 1.800 compute unit mỗi tháng, mà theo lời tác giả phần lớn là "idle timeouts I forgot to kill", trong khi số giờ GPU thực sự chạy job chỉ khoảng 35 mỗi tháng. Quy ra 1,43 USD cho mỗi giờ GPU hữu ích. Đáng chú ý hơn con số đó: 9 lần bị chặn bởi thông báo "you've used too much GPU, come back tomorrow" — trên gói trả phí.
Đây là số liệu cá nhân của một người dùng, không phải benchmark của Google. Nhưng cơ chế tạo ra nó thì quen thuộc với bất kỳ ai dùng notebook: kernel để mở, GPU vẫn bị giữ, hạn mức trôi đi trong lúc bạn đi họp.
12GB VRAM chạy được gì
Tác giả cho biết một chiếc RTX 3060 12GB cũ có giá 180 USD, và tính theo giá Colab thì điểm hoà vốn rơi vào "under 4 months". Số liệu tác giả đo trên chính máy đó:
ModelVRAMTốc độ
qwen2.5:7b-instruct-q4_K_M4.7GB~28 tok/s
qwen2.5:14b-instruct-q4_K_M9.2GB~15 tok/s
llama3.1:8b-q4_K_M5.1GB~31 tok/s
Về fine-tune, tác giả ghi: "Fine-tune 7B with Unsloth QLoRA → fits in 11GB, ~45 min per epoch on 5k samples". Tổng chi phí vận hành sau khi chuyển được tác giả tổng kết là "$0/month vs $49.99/month", với Colab free tier giữ lại cho vài job cần T4.
Stack thay ba subscription coding
Bài thứ hai huỷ ba gói trong một buổi chiều: Cursor 20 USD/tháng, GitHub Copilot 10 USD/tháng, Windsurf 15 USD/tháng — theo tác giả là 540 USD/năm. Bộ thay thế gồm Ollama chạy Qwen2.5-Coder 7B cho completion, Continue.dev làm chat trong VS Code, Tabby làm completion server self-hosted, MonkeyCode cho agentic workflow. Model tải bằng một lệnh: ollama pull qwen2.5-coder:7b — dung lượng 4.7GB và theo ghi chú trong bài thì "runs on 8GB RAM".
Sau 60 ngày, bảng chấm điểm của tác giả: latency completion ~180ms chạy local so với ~300ms qua mạng, nhưng chất lượng chat khi refactor chỉ 6/10 so với 8/10 của bộ trả phí. Hai dòng còn lại trong bảng là thứ khó quy ra tiền: chạy được khi không có mạng, và code không rời khỏi máy.
Đánh đổi phải nhìn thẳng
Phân tích: chỗ quyết định là con số 6/10, không phải con số 0 đồng. Nếu phần lớn thời gian bạn viết completion trong file và sửa lỗi cục bộ, một model 7B chạy local vừa đủ dùng vừa phản hồi nhanh hơn. Nếu bạn dựa vào agent đọc nhiều file rồi refactor xuyên module, khoảng cách chất lượng sẽ lộ ra ngay trong tuần đầu — và thời gian bạn mất để sửa sau đó đắt hơn 45 USD/tháng. Với team ở VN, hai yếu tố cộng thêm về phía local: code không đi ra ngoài, và không phải xoay thẻ quốc tế cho từng subscription.
Làm gì trước kỳ gia hạn
Mở bảng usage Colab, đối chiếu compute unit đã tiêu với số giờ bạn thật sự chạy job. Nếu tỉ lệ lệch như trên, vấn đề là idle timeout chứ không phải hạn mức.
Kiểm tra VRAM của GPU đang có rồi đối chiếu với bảng trên: model 7B q4 cần 4.7GB, còn mức 14B đã là 9.2GB.
Chạy thử một tuần Ollama + Continue.dev song song với bộ trả phí, giữ nguyên subscription. Huỷ sau khi có số của chính bạn, không phải số của tác giả.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)