Belum ada API Gemini 4 Argon yang tersedia untuk publik, dan Google belum menerbitkan ID modelnya. Google mengumumkan Argon pada 30 September 2026, dan saat ini model tersebut hanya tersedia untuk mitra Program Fairwind melalui Gemini Enterprise. Artificial Analysis mencantumkan Google AI Studio sebagai satu-satunya penyedia API Argon, tetapi tanpa data kecepatan atau latensi—indikasi akses pra-rilis, bukan endpoint yang dapat didaftarkan. Google menyatakan peluncuran lebih luas akan dimulai dengan pelanggan API berbayar dan pelanggan Google AI Ultra.
Sambil menunggu akses, siapkan integrasi yang dapat beralih ke Argon hanya dengan mengubah satu variabel konfigurasi. Artikel ini membedakan fakta yang sudah dikonfirmasi dari yang belum tersedia, lalu menggunakan Gemini 3.8 Flash sebagai model pengembangan untuk menguji permintaan, menyiapkan pemeriksaan go-live, membuat mock di Apidog, dan memasang batas biaya. Untuk konteks modelnya, baca apa itu Gemini 4 Argon dan tanggal rilis Gemini 4 Argon.
Apa yang telah dikonfirmasi tentang API Gemini 4 Argon, dan apa yang belum
Postingan peluncuran Google mengonfirmasi harga dan batas output. Detail integrasi lainnya masih belum dipublikasikan.
| Item | Status | Detail |
|---|---|---|
| Harga input | Dikonfirmasi | $2 per 1 juta token saat perkenalan, $4 setelahnya |
| Harga output | Dikonfirmasi | $10 per 1 juta token saat perkenalan, $20 setelahnya |
| Input yang di-cache | Dikonfirmasi | Diskon 95%: $0,10 saat perkenalan, $0,20 standar |
| Batas output | Dikonfirmasi | Hingga 1 juta token, naik dari 64K |
| Antarmuka API | Sinyal | Dokumen Google menyatakan model baru diluncurkan di Interactions API |
| ID model | Belum diterbitkan | Tidak tercantum di halaman model, harga, atau changelog |
| Jendela konteks input | Belum diterbitkan | Evaluasi konteks panjang memakai prompt hingga 1 juta token, tetapi itu bukan spesifikasi |
| Tingkat pemikiran | Belum diterbitkan | Evaluasi memakai “pengaturan pemikiran tertinggi”; nama dan default belum diketahui |
| Batas kecepatan | Belum diterbitkan | Belum ada tingkatan yang diumumkan |
| Dukungan batch | Belum diterbitkan | Belum ada harga batch atau Flex |
| Tingkat prompt panjang | Belum diterbitkan | Aturan harga Argon untuk prompt panjang belum disebutkan |
| Durasi periode perkenalan | Belum diterbitkan | Tidak ada tanggal akhir untuk harga $2/$10 |
Dua detail perlu menjadi dasar desain integrasi:
-
Dokumen API Interaksi menyatakan bahwa model baru akan diluncurkan di Interactions API. Karena Argon adalah model baru, gunakan Interactions API sebagai jalur utama. Google belum mengonfirmasi dukungan
generateContent. - Batas output 1 juta token adalah batas yang disebutkan Google, tetapi Vals AI mencantumkan output maksimum 262K pada konfigurasi yang diuji. Jangan mengasumsikan semua endpoint langsung mendukung 1 juta token penuh pada hari pertama.
Panduan token output 1 juta membahas dampaknya pada streaming, timeout, dan penyimpanan.
Untuk estimasi biaya, prompt 20.000 token dan output 5.000 token dihitung sebagai berikut:
Input: 20.000 × $2 / 1.000.000 = $0,04
Output: 5.000 × $10 / 1.000.000 = $0,05
Total: $0,09
Dengan tarif standar $4/$20, permintaan yang sama berbiaya $0,18. Harga output perkenalan Argon ($10) berada di bawah $12 Gemini 3.1 Pro Preview, sedangkan harga standarnya sama dengan Claude Opus 5.5. Lihat rincian skenario biaya, input cache, dan respons maksimum di harga Gemini 4 Argon.
Jangan menuliskan ID model dugaan ke dalam kode
Anda mungkin menemukan string ID Argon di situs benchmark, agregator, atau pull request open-source. Anggap semuanya sebagai placeholder. Google belum mengonfirmasi ID tersebut.
Menggunakan ID tebakan dapat menghasilkan:
- HTTP 404 saat deploy produksi.
- Fallback senyap jika wrapper menangkap error terlalu luas.
- Perubahan kode yang tidak perlu saat ID resmi diterbitkan.
Simpan nama model di variabel lingkungan. Gunakan Gemini 3.8 Flash sebagai default pengembangan, lalu ubah nilainya ketika ID Argon resmi tersedia.
export GEMINI_MODEL="gemini-3.8-flash"
export GEMINI_THINKING="medium"
Siapkan kode dengan Gemini 3.8 Flash
Gemini 3.8 Flash (gemini-3.8-flash) menggunakan endpoint, header, dan bentuk respons yang diharapkan juga dipakai Argon. Harga model ini adalah $0,75/$3,75 per 1 juta token hingga 31 Desember 2026.
Simpan API key di variabel GEMINI_API_KEY, bukan di kode sumber. Lihat panduan API Gemini 3.8 Flash untuk pengaturan lengkap.
Langkah 1: Kirim permintaan ke Interactions API
Interactions API adalah API utama Google dan tersedia secara umum sejak Juni 2026. Simpan model serta tingkat pemikiran dalam konfigurasi karena tingkat Argon belum diumumkan.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"
curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"model\": \"${MODEL}\",
\"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
\"generation_config\": {\"thinking_level\": \"${THINKING}\"}
}"
Contoh Python dengan SDK google-genai versi 2.3.0 atau lebih baru:
# pip install "google-genai>=2.3.0"
import os
from google import genai
MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")
client = genai.Client() # membaca GEMINI_API_KEY dari environment
interaction = client.interactions.create(
model=MODEL,
input="List the retry rules a REST client should follow for HTTP 429.",
generation_config={"thinking_level": THINKING},
)
print(interaction.output_text)
Pada Gemini 3.8 Flash, nilai valid untuk thinking_level adalah:
low-
medium— default high
Nilai minimal akan menghasilkan HTTP 400. Baca panduan tingkat pemikiran untuk memahami trade-off biaya dan kualitas.
Untuk percakapan multi-giliran, teruskan ID respons sebelumnya melalui previous_interaction_id. Tambahkan store: false jika Anda ingin menolak penyimpanan di sisi server.
Langkah 2: Pastikan jalur generateContent tetap berfungsi
Banyak aplikasi masih menggunakan endpoint generateContent. Google menyatakan jalur ini tetap didukung, jadi pertahankan sebagai fallback.
curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"contents\": [{
\"parts\": [{
\"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
}]
}],
\"generationConfig\": {
\"thinkingConfig\": {
\"thinkingLevel\": \"${THINKING}\"
}
}
}"
Perhatikan perbedaan struktur tingkat pemikiran:
| API | Lokasi konfigurasi |
|---|---|
| Interactions API | generation_config.thinking_level |
generateContent |
generationConfig.thinkingConfig.thinkingLevel |
Jika klien Anda membungkus kedua API, gunakan Interactions API sebagai jalur default untuk model baru. Terapkan prinsip yang sama pada definisi alat dan function calling. Lihat pemanggilan fungsi Gemini 3.8 Flash.
Langkah 3: Jadwalkan pemeriksaan go-live dengan models.list
Jangan hanya menyegarkan changelog. Periksa daftar model langsung melalui API.
import os
import sys
import requests
resp = requests.get(
"https://generativelanguage.googleapis.com/v1beta/models",
params={"pageSize": 1000},
headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
timeout=30,
)
resp.raise_for_status()
hits = [
model
for model in resp.json().get("models", [])
if "argon" in model["name"].lower()
]
for model in hits:
print(
model["name"],
"in:", model.get("inputTokenLimit"),
"out:", model.get("outputTokenLimit"),
model.get("supportedGenerationMethods"),
)
sys.exit(1 if hits else 0) # run gagal = sinyal untuk alert
Jalankan skrip ini setiap jam dari cron atau CI menggunakan API key yang sama dengan aplikasi produksi.
Saat panggilan dijalankan pada 1 Oktober 2026 menggunakan kunci proyek berbayar, API mengembalikan 61 model, tanpa nextPageToken, dan tidak ada nama yang mengandung argon.
Ketika Argon muncul, satu respons ini akan memberi Anda:
- ID model resmi.
- Nilai aktual
outputTokenLimit. - Metode generasi yang didukung.
Langkah 4: Simulasikan respons sebelum akses Argon tersedia
Anda tidak perlu menunggu akses Argon untuk membangun klien.
- Simpan permintaan
generateContentdari Langkah 2 di Apidog. - Buat variabel lingkungan
GEMINI_API_KEYdanGEMINI_MODEL. - Jalankan sekali terhadap Gemini 3.8 Flash.
- Simpan respons aktual sebagai contoh respons endpoint.
- Ubah metode mock proyek menjadi Response example first melalui: Pengaturan Proyek → Pengaturan Fitur → Pengaturan Mock.
- Gunakan URL mock untuk menguji front end, queue worker, dan parser tanpa menghabiskan token.
Mock tersebut merepresentasikan skema respons Gemini saat ini, bukan respons Argon yang spesifik, karena Google belum menerbitkan skema Argon. Namun, pendekatan ini tetap relevan karena Argon diperkirakan menggunakan API yang sama.
Untuk menguji jalur respons besar, edit usageMetadata pada contoh respons dengan jumlah token tinggi. Pastikan sistem penagihan, batas biaya, dan peringatan Anda merespons dengan benar.
Langkah 5: Verifikasi usageMetadata dan batas biaya
Setiap respons generateContent menyertakan usageMetadata. Tambahkan post-processor Apidog berikut untuk menghitung biaya dengan tarif standar Argon.
// Apidog post-processor: harga respons menggunakan tarif standar Gemini 4 Argon
const u = pm.response.json().usageMetadata;
const IN = 4 / 1e6; // USD per input token setelah periode perkenalan
const OUT = 20 / 1e6; // USD per output token
// Pada model Gemini saat ini, token pemikiran ditagih sebagai output.
const out = (u.candidatesTokenCount || 0) + (u.thoughtsTokenCount || 0);
const cost = u.promptTokenCount * IN + out * OUT;
pm.test("usageMetadata tersedia", () => {
pm.expect(u).to.be.an("object");
});
pm.test("biaya di bawah $0,10 dengan tarif Argon", () => {
pm.expect(cost).to.be.below(0.10);
});
Tentukan batas biaya per permintaan sesuai kasus penggunaan. Batas $0,10 cocok untuk prompt pendek seperti contoh ini.
Google belum mengonfirmasi bagaimana Argon akan menagih token pemikiran. Skrip di atas menggunakan aturan Gemini saat ini: token pemikiran dihitung sebagai output. Jalankan koleksi yang sama pada Gemini 3.8 Flash sekarang dan Argon nanti untuk membandingkan jumlah token serta biaya.
FAQ
Apakah API Gemini 4 Argon sudah tersedia?
Belum untuk publik. Argon saat ini diluncurkan kepada sejumlah mitra Program Fairwind melalui Gemini Enterprise. Pelanggan API berbayar dan pelanggan Google AI Ultra akan menyusul tanpa tanggal yang diumumkan.
Apa ID model Gemini 4 Argon?
Google belum menerbitkannya. String dari situs pihak ketiga adalah placeholder. Simpan model dalam variabel lingkungan dan pantau models.list.
Berapa biaya API Gemini 4 Argon?
$2 untuk input dan $10 untuk output per 1 juta token selama periode perkenalan yang durasinya belum diumumkan. Setelah itu, harganya menjadi $4 untuk input dan $20 untuk output. Input yang di-cache mendapat diskon 95%. Lihat harga Gemini 4 Argon.
Apakah Argon akan berfungsi dengan generateContent?
Google belum mengonfirmasinya. Dokumentasi menyatakan model baru diluncurkan melalui Interactions API, jadi bangun integrasi di atas Interactions API dan perlakukan generateContent sebagai fallback.
Apakah Google AI Ultra memberi akses API?
Tidak. AI Ultra adalah langganan konsumen, bukan API key. Google menyatakan akses API akan dimulai dengan pelanggan API berbayar.
Langkah Anda selanjutnya
- Atur
GEMINI_MODELdi semua lingkungan. - Jalankan pemeriksaan
models.listterjadwal. - Simpan permintaan Interactions API dan
generateContent. - Tambahkan validasi
usageMetadataserta batas biaya. - Ubah satu variabel konfigurasi saat Google menerbitkan ID Argon.
Unduh Apidog untuk menyimpan permintaan, mock, dan pengujian dalam satu workspace.

Top comments (0)