DEV Community

Cover image for Gemini 4 Argon API: Thông tin xác nhận, Chi phí dự kiến và Cách chuẩn bị mã nguồn
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Gemini 4 Argon API: Thông tin xác nhận, Chi phí dự kiến và Cách chuẩn bị mã nguồn

Chưa có API Gemini 4 Argon công khai nào và Google cũng chưa công bố ID mô hình. Google đã công bố Argon vào ngày 30 tháng 9 năm 2026 và hiện tại nó chỉ dành cho những người tham gia Chương trình Fairwind: một nhóm đối tác Fairwind sử dụng nó như một mô hình được quản lý trên Gemini Enterprise. Artificial Analysis liệt kê Google AI Studio là nhà cung cấp API duy nhất của Argon, nhưng không có dữ liệu về tốc độ hoặc độ trễ. Điều này phù hợp với quyền truy cập trước phát hành được cấp phép hơn là một điểm cuối mà bạn có thể đăng ký. Khi đợt triển khai rộng rãi hơn bắt đầu, Google cho biết sẽ ưu tiên “các khách hàng API trả phí và người đăng ký Google AI Ultra”, vì vậy khóa API Gemini trả phí có thể giúp bạn được ưu tiên.

Dùng thử Apidog ngay hôm nay

Khoảng thời gian giữa thông báo và quyền truy cập là lúc bạn nên chuẩn bị tích hợp. Hướng dẫn này phân biệt những gì Google đã xác nhận với những gì chưa công bố, sau đó dùng Gemini 3.8 Flash để xây dựng mã có thể chuyển sang Argon bằng cách thay đổi một biến môi trường. Bạn sẽ gửi yêu cầu, thiết lập cảnh báo sẵn sàng hoạt động, mô phỏng phản hồi trong Apidog, và thêm giới hạn chi phí theo giá Argon. Để tìm hiểu về mô hình, hãy xem Gemini 4 Argon là gì; để biết các giai đoạn triển khai, xem hướng dẫn ngày phát hành Gemini 4 Argon.

Những gì đã được xác nhận về API Gemini 4 Argon và những gì chưa

Bài đăng ra mắt của Google cung cấp giá cả và giới hạn đầu ra. Tuy nhiên, phần lớn thông tin cần thiết để tích hợp vẫn chưa được công bố.

Mục Trạng thái Chi tiết
Giá đầu vào Đã xác nhận $2 cho 1 triệu token trong thời gian giới thiệu, $4 sau đó
Giá đầu ra Đã xác nhận $10 cho 1 triệu token trong thời gian giới thiệu, $20 sau đó
Đầu vào đã lưu vào bộ nhớ cache Đã xác nhận Giảm 95% giá đầu vào: $0.10 giới thiệu, $0.20 tiêu chuẩn
Giới hạn đầu ra Đã xác nhận 1 triệu token, tăng từ 64K
Bề mặt API Đã báo hiệu Tài liệu Google cho biết mọi mô hình mới sẽ ra mắt trên Interactions API
ID mô hình Chưa công bố Không có trên trang mô hình, trang giá hoặc nhật ký thay đổi
Cửa sổ ngữ cảnh đầu vào Chưa công bố Đánh giá ngữ cảnh dài của Google dùng lời nhắc tới 1 triệu token, nhưng đây không phải đặc tả
Mức độ tư duy Chưa công bố Đánh giá chạy ở “cài đặt tư duy cao nhất”; tên và mặc định chưa rõ
Giới hạn tốc độ Chưa công bố Chưa có cấp độ nào được công bố
Hỗ trợ hàng loạt Chưa công bố Không có giá hàng loạt hoặc Flex
Cấp độ lời nhắc dài Chưa công bố 3.1 Pro tính phí cao hơn trên 200K token; quy tắc Argon chưa được nêu
Thời gian giới thiệu Chưa công bố Không có ngày kết thúc cho mức giá $2/$10

Hai điểm cần chú ý:

  1. Bề mặt API: Tài liệu Interactions API nói rằng các mô hình mới “sẽ ra mắt trên Interactions API”. Argon là mô hình mới, vì vậy hãy ưu tiên chuẩn bị tích hợp qua API này. Google chưa xác nhận liệu generateContent có hỗ trợ Argon hay không.
  2. Giới hạn đầu ra: Google công bố giới hạn 1 triệu token, nhưng Vals AI liệt kê đầu ra tối đa 262K cho cấu hình họ đã thử nghiệm. Đừng giả định mọi điểm cuối đều cung cấp đủ 1 triệu token ngay từ ngày đầu tiên. Hướng dẫn 1 triệu token đầu ra giải thích tác động đến streaming, timeout và lưu trữ.

Gemini 4 Argon

Ví dụ, một yêu cầu có 20.000 token đầu vào và 5.000 token đầu ra sẽ có giá:

20.000 × $2 / 1M + 5.000 × $10 / 1M
= $0.04 + $0.05
= $0.09
Enter fullscreen mode Exit fullscreen mode

Theo giá tiêu chuẩn $4/$20, cùng yêu cầu đó có giá $0.18. Giá đầu ra giới thiệu của Argon ($10) thấp hơn $12 của Gemini 3.1 Pro Preview; giá tiêu chuẩn $20 tương đương Claude Opus 5.5. Xem phân tích giá Gemini 4 Argon để biết các kịch bản gồm đầu vào cache và phản hồi tối đa 1 triệu token.

Không nên mã hóa cứng ID mô hình bạn tìm thấy trực tuyến

Khi tìm kiếm ID Argon, bạn có thể thấy chuỗi tên trên trang benchmark, trình tổng hợp hoặc pull request mã nguồn mở. Đây chỉ là chỗ dành sẵn:

  • Vals AI dùng slug riêng cho trang mô hình.
  • Một pull request GitHub có thể thêm ID “tạm thời”.
  • Đường dẫn kiểu OpenRouter có thể dẫn tới trang không tìm thấy.

Google chưa xác nhận bất kỳ ID nào trong số đó. Mã hóa cứng một giá trị phỏng đoán có thể dẫn đến HTTP 404 khi triển khai, hoặc gây fallback im lặng nếu wrapper của bạn bắt lỗi quá rộng.

Thay vào đó, hãy đưa tên mô hình vào cấu hình. Các ví dụ bên dưới dùng biến môi trường GEMINI_MODEL, mặc định là gemini-3.8-flash. Khi Google công bố ID Argon, bạn chỉ cần thay đổi giá trị này.

Chuẩn bị mã trên Gemini 3.8 Flash

Gemini 3.8 Flash (gemini-3.8-flash) chạy trên cùng điểm cuối, tiêu đề và cấu trúc phản hồi mà Argon dự kiến sẽ dùng, với giá $0.75/$3.75 cho mỗi 1 triệu token đến hết ngày 31 tháng 12 năm 2026.

Lưu khóa API trong biến môi trường GEMINI_API_KEY; không dán khóa vào mã nguồn. Xem thiết lập đầy đủ trong hướng dẫn API Gemini 3.8 Flash.

Bước 1: Gửi yêu cầu qua Interactions API

Interactions API là API chính của Google và đã sẵn sàng rộng rãi từ tháng 6 năm 2026. Giữ cả tên mô hình lẫn cấp độ tư duy trong biến môi trường vì tên cấp độ của Argon chưa được công bố.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"${MODEL}\",
    \"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
    \"generation_config\": {\"thinking_level\": \"${THINKING}\"}
  }"
Enter fullscreen mode Exit fullscreen mode

Python SDK yêu cầu google-genai phiên bản 2.3.0 trở lên:

# pip install "google-genai>=2.3.0"
import os
from google import genai

MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")

client = genai.Client()  # đọc GEMINI_API_KEY từ biến môi trường

interaction = client.interactions.create(
    model=MODEL,
    input="List the retry rules a REST client should follow for HTTP 429.",
    generation_config={"thinking_level": THINKING},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Trên 3.8 Flash, các cấp độ hợp lệ là low, medium và high. Giá trị minimal trả về HTTP 400. Xem hướng dẫn về cấp độ tư duy để chọn mức phù hợp với độ trễ và chi phí.

Với tác vụ nhiều lượt, truyền ID phản hồi trước qua previous_interaction_id. Nếu không muốn lưu phía máy chủ, gửi thêm store: false.

Bước 2: Duy trì đường dẫn generateContent

Nhiều ứng dụng hiện có vẫn gọi generateContent, và Google cho biết API này vẫn được hỗ trợ. Dưới đây là yêu cầu tương đương:

curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"contents\": [{
      \"parts\": [{
        \"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
      }]
    }],
    \"generationConfig\": {
      \"thinkingConfig\": {
        \"thinkingLevel\": \"${THINKING}\"
      }
    }
  }"
Enter fullscreen mode Exit fullscreen mode

Lưu ý vị trí cấu hình tư duy khác nhau:

API Trường cấu hình
Interactions generation_config.thinking_level
generateContent generationConfig.thinkingConfig.thinkingLevel

Nếu client của bạn bao bọc cả hai API, hãy định tuyến mô hình mới qua Interactions theo mặc định. Định nghĩa công cụ cũng cần được xử lý tương tự; xem Gemini 3.8 Flash function calling.

Bước 3: Lên lịch kiểm tra khả dụng bằng models.list

Đừng liên tục làm mới nhật ký thay đổi. Hãy hỏi API models, nơi trả về danh sách mô hình khả dụng, giới hạn token và phương thức được hỗ trợ.

import os
import sys
import requests

resp = requests.get(
    "https://generativelanguage.googleapis.com/v1beta/models",
    params={"pageSize": 1000},
    headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
    timeout=30,
)

resp.raise_for_status()

hits = [
    m for m in resp.json().get("models", [])
    if "argon" in m["name"].lower()
]

for m in hits:
    print(
        m["name"],
        "in:", m.get("inputTokenLimit"),
        "out:", m.get("outputTokenLimit"),
        m.get("supportedGenerationMethods"),
    )

sys.exit(1 if hits else 0)  # coi lần chạy có kết quả là cảnh báo
Enter fullscreen mode Exit fullscreen mode

Chạy script này hàng giờ bằng cron hoặc lịch CI, với chính khóa API mà ứng dụng production sử dụng.

Khi lệnh gọi được chạy vào ngày 1 tháng 10 năm 2026 bằng khóa dự án trả phí, nó trả về 61 mô hình, không có nextPageToken, và không có tên nào chứa argon. Khi có kết quả, bạn sẽ biết ngay:

  • ID mô hình thực tế.
  • outputTokenLimit có đạt đủ 1 triệu token hay không.
  • Các phương thức được hỗ trợ.

Ví dụ cron chạy mỗi giờ:

0 * * * * /usr/bin/python3 /app/check_argon.py || /app/send-alert.sh
Enter fullscreen mode Exit fullscreen mode

Bước 4: Mô phỏng phản hồi trước khi có quyền truy cập

Bạn không cần Argon để xây dựng client tiêu thụ phản hồi Argon.

  1. Lưu yêu cầu generateContent ở bước 2 trong Apidog.
  2. Khai báo GEMINI_API_KEY và GEMINI_MODEL là biến môi trường.
  3. Gửi một lần tới Gemini 3.8 Flash.
  4. Lưu phản hồi thực làm ví dụ phản hồi của endpoint.
  5. Trong Project Settings → Feature Settings → Mock Settings, đặt chế độ mock mặc định là Response example first.
  6. Dùng URL mock cho frontend, worker hàng đợi và parser thay vì gọi API thật.

Smart Mock mặc định của Apidog tạo dữ liệu từ lược đồ. Chế độ Response example first giúp mock trả lại phản hồi Gemini thực mà bạn đã lưu, nên các thành phần phía client có thể chạy mà không tốn token.

Mock này là lược đồ phản hồi Gemini hiện tại, không phải lược đồ riêng của Argon, vì Google chưa công bố lược đồ đó. Tuy vậy, đây vẫn là cách chuẩn bị hợp lý vì Argon dự kiến dùng cùng API.

Để diễn tập phản hồi lớn, chỉnh sửa usageMetadata trong response example thành các giá trị cao và kiểm tra xem mã tính cước, cảnh báo, timeout và hàng đợi của bạn có phản ứng đúng không.

Bước 5: Kiểm tra usageMetadata và giới hạn chi phí

Mỗi phản hồi generateContent chứa usageMetadata. Thêm script hậu xử lý trong Apidog để định giá phản hồi theo mức giá tiêu chuẩn của Argon và làm test thất bại trước khi chi phí vượt ngưỡng.

// Trình xử lý hậu kỳ Apidog:
// định giá phản hồi theo mức giá tiêu chuẩn của Gemini 4 Argon

const u = pm.response.json().usageMetadata;

const IN = 4 / 1e6;   // USD cho mỗi token đầu vào sau thời gian giới thiệu
const OUT = 20 / 1e6; // USD cho mỗi token đầu ra

// Token "suy nghĩ" được tính là đầu ra trên các mô hình Gemini hiện tại
const out = (u.candidatesTokenCount || 0) + (u.thoughtsTokenCount || 0);

const cost = u.promptTokenCount * IN + out * OUT;

pm.test("usageMetadata có mặt", () => {
  pm.expect(u).to.be.an("object");
});

pm.test("chi phí dưới $0.10 theo tỷ giá Argon", () => {
  pm.expect(cost).to.be.below(0.10);
});
Enter fullscreen mode Exit fullscreen mode

Chọn ngưỡng phù hợp với từng loại yêu cầu. Với lời nhắc ngắn như ví dụ này, $0.10 là mức hợp lý.

Google chưa nêu rõ Argon sẽ tính phí token tư duy như thế nào, vì vậy script trên giả định quy tắc Gemini hiện tại. Hãy giữ nguyên yêu cầu đã lưu, chạy với 3.8 Flash ngay bây giờ và Argon sau này. Chênh lệch token và chi phí sẽ trở thành dữ liệu hồi quy của bạn.

Câu hỏi thường gặp

API Gemini 4 Argon đã có sẵn chưa?

Chưa công khai. Argon hiện chỉ được triển khai cho một nhóm đối tác Chương trình Fairwind qua Gemini Enterprise. Khách hàng API trả phí và người đăng ký Google AI Ultra sẽ là nhóm tiếp theo, nhưng chưa có ngày cụ thể.

ID mô hình Gemini 4 Argon là gì?

Google chưa công bố. Các chuỗi tên trên trang bên thứ ba chỉ là chỗ dành sẵn. Hãy giữ tên mô hình trong biến môi trường và theo dõi models.list.

API Gemini 4 Argon sẽ có giá bao nhiêu?

$2 đầu vào và $10 đầu ra cho mỗi 1 triệu token trong thời gian giới thiệu chưa xác định; sau đó là $4 và $20. Đầu vào đã lưu cache giảm 95%. Xem giá Gemini 4 Argon.

Argon sẽ hoạt động với generateContent chứ?

Google chưa xác nhận. Tài liệu nói các mô hình mới sẽ ra mắt qua Interactions API, vì vậy hãy xây dựng trên Interactions và giữ generateContent làm phương án dự phòng.

Google AI Ultra có cung cấp quyền truy cập API không?

Không. AI Ultra là gói đăng ký người tiêu dùng, không phải khóa API. Google cho biết quyền truy cập API sẽ bắt đầu với khách hàng API trả phí.

Bước tiếp theo của bạn

Thực hiện checklist sau:

  • Đặt GEMINI_MODEL trong mọi môi trường.
  • Mặc định giá trị này là gemini-3.8-flash.
  • Lên lịch kiểm tra models.list.
  • Lưu yêu cầu Interactions và generateContent.
  • Thêm mock phản hồi và test chi phí.
  • Chỉ thay đổi GEMINI_MODEL khi Google công bố ID Argon chính thức.

Tải Apidog để lưu yêu cầu, mock và test trong cùng một workspace.

Top comments (0)