DEV Community

BeanBean
BeanBean

Posted on Originally published at nextfuture.io.vn

Prompt engineering hay fine-tuning: chọn gì cho 2026?

Originally published on NextFuture

Team bạn đang cân nhắc fine-tune một model để ép đúng giọng văn hoặc đúng format JSON, và ai đó vừa hỏi ngân sách. Trước khi mở dataset, có một phép so sánh chi phí nên làm xong trong một buổi. Bài này tóm tắt khung quyết định từ một guide 2026 trên Dev.to, kèm cảnh báo về chỗ bài viết đó bán hàng.

Ba thứ đã đổi phép tính trong năm qua

Lập luận của bài viết: prompt engineering thắng ở đa số sản phẩm vì ba thay đổi. Thứ nhất, model rẻ đi mạnh — tác giả dẫn mức giá 0,14 USD cho 1 triệu input token của DeepSeek V4 Flash, đủ rẻ để một prompt dài chỉ tốn vài phần trăm cent. Thứ hai, context window và caching nở ra: với context 128K và automatic caching cắt khoảng 90% chi phí input lặp lại, bạn nhồi được style guide, schema và few-shot example vào mọi request gần như miễn phí. Thứ ba, structured output đã ổn định — JSON mode, function calling và constrained decoding khiến bạn không cần fine-tune chỉ để lấy output hợp lệ.

Tác giả nói rõ điều này không làm fine-tuning lỗi thời, mà biến nó thành một khoản đầu tư có chủ đích thay vì phản xạ mặc định.

Fine-tuning tốn gì mà team hay tính thiếu

Phần đáng đọc nhất là bảng bóc chi phí. Theo bài viết, chuẩn bị dữ liệu — làm sạch, gán nhãn, khử trùng lặp hàng nghìn mẫu — thường ngốn 2-4 tuần công của kỹ sư. Training compute rơi vào khoảng 500-5.000 USD trở lên mỗi lần chạy tuỳ kích thước model. Sau đó vẫn phải dựng eval set và scoring harness để chứng minh bản fine-tune thực sự tốt hơn, rồi chạy lại toàn bộ pipeline mỗi lần base model nâng cấp hoặc dữ liệu trôi.

Và cái bẫy: theo tác giả, fine-tune một model vốn đã mạnh hiếm khi tạo bước nhảy lớn — mức cải thiện so với baseline được prompt tốt thường chỉ 5-15% trên một chỉ số hẹp. Đây là con số của bài viết, không phải kết quả đo độc lập.

Bài viết dựng một phép so sánh mô phỏng cho workload 100 nghìn request/tháng, mỗi request khoảng 1,5 nghìn token: bản prompt-engineered trên DeepSeek V4 Flash rơi vào khoảng 52 USD/tháng, còn đường fine-tune tốn 2.000-10.000 USD trở lên cho phần dữ liệu và training, chưa tính hosting hay inference — và tất cả trước khi bạn chứng minh được nó thắng cái prompt.

Khung quyết định, rút gọn

Bảng quyết định trong bài quy về một mẫu hình khá dứt khoát:

  • Đang thăm dò ý tưởng, cần style hoặc tone cụ thể, cần JSON schema cố định → prompt engineering.

  • Thiếu kiến thức miền → prompt engineering cộng retrieval (RAG), vì rẻ hơn training và cập nhật được.

  • Hành vi hẹp, lặp lại, chạy ở volume lớn → fine-tuning, nhưng chỉ khi đã có eval harness chứng minh mức lợi.

  • Base model cũ và yếu ở tác vụ đó → fine-tune hoặc đổi model; đôi khi một model mới giá rẻ đánh bại một model cũ đã tune.

Playbook lai mà bài viết đề xuất: prompt cho 80% khối lượng, log lại chỗ prompt hỏng, rồi chỉ fine-tune đúng lát cắt lỗi đó với dataset nhỏ và có mục tiêu. Giữ base model swappable bằng cách chạy qua endpoint tương thích OpenAI, để tên model là một giá trị cấu hình chứ không phải một cam kết.

Đọc bài này với một hạt muối

Cần nói thẳng: bài gốc là content marketing cho một API gateway, kết bằng lời mời đăng ký và tặng credit. Toàn bộ bảng giá theo model trong bài là số do tác giả đưa ra, không phải giá niêm yết bạn nên trích lại — hãy kiểm tra trực tiếp trên trang giá của nhà cung cấp trước khi đưa vào slide ngân sách.

Phần khung quyết định thì vẫn dùng được, vì nó không phụ thuộc vào con số cụ thể nào. Hai thói quen đáng giữ lại: luôn đặt max_tokens vì output token đắt hơn input nhiều lần, và thử prompt trên hai ba model trước khi nghĩ tới một lần training.

Việc nên làm tuần này

Lấy đúng một tác vụ mà team đang định fine-tune, viết một prompt tử tế kèm few-shot example, rồi chấm nó trên 30-50 mẫu thật của bạn. Nếu prompt đã chạm ngưỡng chấp nhận được, quyết định fine-tune vừa tự huỷ — và bạn tiết kiệm được vài tuần.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)