DEV Community

Cover image for So sánh Gemini 4 Argon và Gemini 3.8 Flash: Nên chờ Argon hay dùng Flash ngay bây giờ?
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

So sánh Gemini 4 Argon và Gemini 3.8 Flash: Nên chờ Argon hay dùng Flash ngay bây giờ?

Gemini 3.8 Flash có sẵn ngay hôm nay: đây là mô hình ổn định, có gói miễn phí, giá $0.75 cho đầu vào và $3.75 cho đầu ra trên mỗi 1 triệu token đến hết ngày 31 tháng 12 năm 2026; sau đó là $1.50 và $7.50. Giới hạn đầu ra là 64K token. Gemini 4 Argon thì chưa khả dụng rộng rãi. Bài đăng ra mắt của Google định giá Argon ở mức $2 và $10 trong thời gian giới thiệu chưa xác định, sau đó là $4 và $20. Google công bố giới hạn đầu ra 1 triệu token, nhưng hiện Argon chỉ dành cho một nhóm đối tác trong Chương trình Fairwind. Nếu cần triển khai trong quý này, hãy dùng Flash và thiết kế cấu hình để có thể chuyển sang Argon chỉ bằng một biến.

Dùng thử Apidog ngay hôm nay

Bài viết này so sánh thông số kỹ thuật, các hàng benchmark được cả hai bài ra mắt công bố, điểm cyber và chi phí cho cùng một cuộc gọi. Cuối bài là cách thiết lập yêu cầu để đổi mô hình mà không phải sửa code. Xem thêm: Gemini 4 Argon là gì và Gemini 3.8 Flash là gì.

So sánh trực tiếp: những gì bạn có thể sử dụng ngay hôm nay

Gemini 3.8 Flash Gemini 4 Argon
Khả dụng Ổn định trên Gemini API, AI Studio, Antigravity và Gemini Enterprise Một tập hợp con các đối tác Chương trình Fairwind, dưới dạng mô hình được quản lý trên Gemini Enterprise
ID mô hình gemini-3.8-flash Chưa công bố
Giá mỗi 1 triệu token (đầu vào / đầu ra) $0.75 / $3.75 đến 31-12-2026, sau đó $1.50 / $7.50 $2 / $10 giới thiệu, sau đó $4 / $20
Đầu vào được lưu vào bộ nhớ cache mỗi 1 triệu $0.075, sau đó $0.15 $0.10 giới thiệu, sau đó $0.20 (giảm 95% đầu vào)
Giới hạn đầu ra 65.536 token 1 triệu token theo công bố của Google
Cửa sổ đầu vào 1.048.576 token Chưa công bố
Cấp độ tư duy low, medium (mặc định), high; minimal trả về HTTP 400 Chưa được ghi lại
Gói API miễn phí Có, bị giới hạn tốc độ Chưa có thông báo
Truy cập của người tiêu dùng Ứng dụng Gemini trên AI Pro và Ultra, Chế độ AI trong Tìm kiếm Chưa; người đăng ký AI Ultra nằm trong đợt đầu tiên, chưa có ngày cụ thể

Các điểm cần lưu ý trước khi chọn

  • Google chưa công bố cửa sổ đầu vào của Argon, dù các đánh giá ngữ cảnh dài của họ dùng prompt đến 1 triệu token.
  • Google nói giới hạn đầu ra của Argon là 1 triệu token. Tuy nhiên, Vals AI liệt kê đầu ra tối đa 262K cho cấu hình họ đã thử nghiệm.
  • Các đánh giá Argon chạy với “thiết lập tư duy cao nhất”, nhưng Google chưa công bố tên cấp độ hay cấp độ mặc định.
  • Flash hỗ trợ low, medium và high. Xem tài liệu tư duy của Google hoặc hướng dẫn cấp độ tư duy Gemini 3.8 Flash.

Gói miễn phí của Flash bị giới hạn tốc độ. Google cũng cho biết dữ liệu từ gói miễn phí “được sử dụng để cải thiện sản phẩm”. Google chưa công bố cách dùng Argon miễn phí; xem hướng dẫn quyền truy cập miễn phí Argon để biết các lựa chọn thay thế.

Các benchmark được cả hai bài ra mắt công bố

Các bài ra mắt của Google cho hai mô hình cùng công bố hai hàng benchmark dưới dạng văn bản. Đây là số liệu do Google báo cáo; phương pháp luận Argon gán cả hai hàng cho Vals AI.

Điểm chuẩn Gemini 3.8 Flash Gemini 4 Argon
Vals Finance Agent v2 61.4% 65.4%
Điểm chuẩn Đại lý Pháp lý Harvey 10.0% 19.6%

Đừng coi đây là thử nghiệm đối chứng hoàn toàn: hai bảng được Google công bố cách nhau một tháng và có các nhóm đối thủ khác nhau. Tuy vậy:

  • Argon cao hơn 4 điểm trên Vals Finance Agent v2.
  • Argon đạt 19.6% trên benchmark pháp lý Harvey, gần gấp đôi Flash ở mức 10.0%.

Các số liệu khác không có đối tác tương ứng trực tiếp trong cả hai bài. Bảng Flash có HLE-Verified, còn bảng Argon thì không. Điểm DeepSWE của Flash chỉ xuất hiện trong ảnh thẻ mô hình. Trên bảng xếp hạng Text của Arena, Argon (Cao) đứng số 1 trong phiếu bầu sơ bộ, còn Gemini 3.8 Flash (Cao) đứng số 11.

Xem bảng Argon đầy đủ 19 hàng và đơn vị đo lường tại phân tích benchmark Argon.

Cyber: Argon so với 3.8 Flash Cyber

Trang cyber của DeepMind so sánh Argon với Gemini 3.8 Flash Cyber, phiên bản Flash được kiểm soát bởi Fairwind.

Đánh giá Cyber Gemini 4 Argon Gemini 3.8 Flash Cyber
Phát hiện lỗ hổng thực tế 85.8% 71.0%
Điểm chuẩn Kiểm tra Xâm nhập Wiz 70.9% 58.2%

Cả hai mô hình đều bị kiểm soát:

  • Gemini 3.8 Flash Cyber có sẵn chung sau danh sách cho phép trên Gemini Enterprise Agent Platform.
  • Argon chỉ dành cho Fairwind.

Nếu bạn không phải đối tác Fairwind, các số liệu cyber này không thay đổi lựa chọn triển khai hiện tại: Gemini 3.8 Flash bản chung là mô hình bạn có thể xây dựng trên đó ngay hôm nay.

Chi phí cho cùng một cuộc gọi

Giả sử một yêu cầu dùng:

  • 100.000 token đầu vào
  • 8.000 token đầu ra

Với các mô hình Gemini hiện tại, gồm 3.8 Flash, token tư duy được tính là token đầu ra. Vì vậy, 8.000 token đầu ra đã bao gồm token tư duy. Google chưa nói rõ Argon tính token tư duy thế nào; các phép tính dưới đây giả định Argon theo cùng cơ chế.

Mô hình và giai đoạn Chi phí đầu vào Chi phí đầu ra Tổng cộng mỗi cuộc gọi
3.8 Flash, giới thiệu 0.1M × $0.75 = $0.075 0.008M × $3.75 = $0.030 $0.105
3.8 Flash, từ 01-01-2027 0.1M × $1.50 = $0.150 0.008M × $7.50 = $0.060 $0.210
Argon, giới thiệu 0.1M × $2 = $0.200 0.008M × $10 = $0.080 $0.280
Argon, tiêu chuẩn 0.1M × $4 = $0.400 0.008M × $20 = $0.160 $0.560

Argon có giá mỗi token bằng 8/3, tức khoảng 2.67 lần Flash, ở cả mức giá giới thiệu lẫn giá tiêu chuẩn.

Với 1.000 cuộc gọi như trên mỗi ngày:

  • Flash ở giá giới thiệu: $105/ngày
  • Argon ở giá giới thiệu: $280/ngày

Ba yếu tố làm chi phí thực tế khác phép tính

  1. Số token không giống nhau giữa hai mô hình.

    Cùng một prompt có thể tạo số token đầu ra và token tư duy khác nhau. Các benchmark Argon chạy ở mức tư duy cao nhất; Google cũng cảnh báo mức nỗ lực cao hơn trên Flash có thể dùng nhiều token hơn.

  2. Đầu ra dài thay đổi hoàn toàn bài toán.

    Câu trả lời 200.000 token không vừa giới hạn 65.536 token của Flash, nên phải chia thành nhiều cuộc gọi. Theo giới hạn công bố của Argon, đây có thể là một phản hồi:

    • Giá giới thiệu: 0.2M × $10 = $2.00
    • Giá tiêu chuẩn: 0.2M × $20 = $4.00

Một đầu ra đầy đủ 1 triệu token có giá $10 giới thiệu hoặc $20 tiêu chuẩn.

  1. Chỉ Flash có ngày kết thúc giá giới thiệu rõ ràng. Giá giới thiệu của Flash kết thúc ngày 31 tháng 12 năm 2026. Google chưa công bố ngày kết thúc giá giới thiệu của Argon.

Flash còn có Batch giảm giá 50%: $0.375 cho đầu vào và $1.875 cho đầu ra đến hết ngày 31 tháng 12, theo trang giá Gemini API. Google chưa công bố giá Batch cho Argon.

Xem thêm hướng dẫn định giá Argon và hướng dẫn định giá Gemini 3.8 Flash.

Bạn nên chờ Argon hay triển khai trên Flash?

Triển khai trên 3.8 Flash ngay bây giờ khi

  • Bạn bị ràng buộc về chi phí. Flash có giá bằng 3/8 Argon mỗi token; Batch tiếp tục giảm một nửa giá đó.
  • Bạn chạy lưu lượng lớn. Phân loại, trích xuất, định tuyến và chat ở quy mô lớn sẽ tăng chi phí nhanh với mức $10 cho 1 triệu token đầu ra.
  • Bạn cần triển khai ngay. Flash có ID mô hình ổn định, gói miễn phí để tạo nguyên mẫu và lịch giá đã công bố.
  • Phản hồi nằm trong 65.536 token. Đây là trường hợp của phần lớn workload API.

Lập kế hoạch cho Argon khi

  • Công việc yêu cầu suy luận dài hạn. Google mô tả Argon được xây dựng để duy trì suy luận sâu trong workflow phức tạp, dài hạn.
  • Bạn cần đầu ra vượt quá 64K token. Viết lại toàn bộ module, báo cáo dài hoặc migration lớn là các trường hợp cần giới hạn 1 triệu token.
  • Bạn chạy agent pháp lý hoặc tài chính. Đây là hai hàng benchmark được công bố cho cả hai model, và Argon dẫn đầu cả hai.
  • Bạn đủ điều kiện tham gia Fairwind. Argon là model hiện được chương trình này ưu tiên.

Cách tiếp cận thực tế là không cần chọn một lần duy nhất: đưa đa số lưu lượng vào Flash, sau đó định tuyến các yêu cầu khó sang Argon khi mô hình được phát hành rộng hơn.

Một yêu cầu đã lưu, hai mô hình

Giữ tên model trong biến môi trường. Chạy workload thực trên 3.8 Flash ngay bây giờ, rồi thay đổi biến khi Google công bố ID model của Argon. Không đoán ID Argon trước khi Google công bố.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Summarize this contract clause in 3 bullets."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "medium"
      },
      "maxOutputTokens": 8192
    }
  }'
Enter fullscreen mode Exit fullscreen mode

Checklist triển khai

  1. Lưu GEMINI_API_KEY và GEMINI_MODEL trong môi trường.
  2. Cố định maxOutputTokens để một phản hồi dài không vượt ngân sách.
  3. Kiểm tra HTTP 200.
  4. Kiểm tra các trường mà ứng dụng thực sự đọc từ phản hồi.
  5. Ghi lại usageMetadata, đặc biệt là usageMetadata.thoughtsTokenCount.
  6. Đặt ngưỡng token tư duy theo ngân sách của bạn.
  7. Lưu báo cáo chạy Flash làm baseline để so sánh sau này.

Bạn có thể lưu request này trong Apidog, thêm assertions và chạy nó trong test scenario.

Hai lưu ý cho ngày Argon ra mắt

Google nói “tất cả các mô hình mới” sẽ ra mắt trên Interactions API, nhưng chưa xác nhận Argon có hỗ trợ generateContent hay không. Vì vậy, hãy lưu thêm phiên bản Interactions:

POST https://generativelanguage.googleapis.com/v1beta/interactions
Enter fullscreen mode Exit fullscreen mode

Dùng generation_config.thinking_level trong phiên bản Interactions.

Ngoài ra, tên cấp độ tư duy của Argon chưa được ghi lại. Giá trị medium của Flash có thể không chuyển trực tiếp sang Argon. Khi Argon khả dụng:

  1. Chỉ đổi GEMINI_MODEL.
  2. Chạy lại cùng bộ prompt.
  3. So sánh đầu ra.
  4. So sánh usageMetadata.
  5. So sánh chi phí trên workload thực tế, không chỉ giá token niêm yết.

Câu hỏi thường gặp

Gemini 4 Argon có tốt hơn Gemini 3.8 Flash không?

Trên hai hàng benchmark mà cả hai bài ra mắt cùng công bố, có:

  • 65.4% so với 61.4% trên Vals Finance Agent v2.
  • 19.6% so với 10.0% trên benchmark Đại lý Pháp lý Harvey.

Tuy nhiên, Argon đắt hơn khoảng 2.67 lần mỗi token và chưa khả dụng rộng rãi.

Tôi có nên chờ Gemini 4 Argon không?

Không nếu bạn cần triển khai ngay. Google chưa công bố ngày phát hành cụ thể, chỉ nói “sớm nhất có thể”, bắt đầu với khách hàng API trả phí và người đăng ký AI Ultra.

Gemini 3.8 Flash hay Argon cho dự án mới?

Bắt đầu bằng Gemini 3.8 Flash, với tên model nằm trong biến môi trường. Sau khi thử nghiệm Argon bằng prompt và dữ liệu của riêng bạn, hãy chuyển các yêu cầu cần đầu ra dài hoặc chuyên sâu về pháp lý, tài chính sang Argon.

Có cách nào miễn phí để dùng Argon không?

Không. Google chưa công bố gói miễn phí cho Argon. Xem hướng dẫn quyền truy cập miễn phí Argon để biết các model Gemini miễn phí có thể dùng hôm nay.

Argon có thay thế Gemini 3.8 Flash không?

Google chưa nói. Google gọi Argon là model tiên phong mới, và Reuters báo cáo nó lớn hơn dòng Pro trước đó; vì vậy, Argon thuộc một cấp khác với Flash.

Bước tiếp theo

Thiết lập request ngay hôm nay, chạy trên Gemini 3.8 Flash và lưu báo cáo. Khi Argon được phát hành, bạn có thể biết trong vài phút liệu hiệu năng tăng thêm có xứng đáng với chi phí cho lưu lượng thực tế của mình hay không.

Tải xuống Apidog để xây dựng và lưu bộ so sánh này.

Top comments (0)