DEV Community

Cover image for Gemini 4 Argon API: Fakta Terbaru, Harga, dan Persiapan Kode Anda
Walse
Walse

Posted on Originally published at apidog.com

Gemini 4 Argon API: Fakta Terbaru, Harga, dan Persiapan Kode Anda

Belum ada API Gemini 4 Argon yang tersedia untuk publik, dan Google belum menerbitkan ID modelnya. Google mengumumkan Argon pada 30 September 2026, dan saat ini model tersebut hanya tersedia untuk mitra Program Fairwind melalui Gemini Enterprise. Artificial Analysis mencantumkan Google AI Studio sebagai satu-satunya penyedia API Argon, tetapi tanpa data kecepatan atau latensi—indikasi akses pra-rilis, bukan endpoint yang dapat didaftarkan. Google menyatakan peluncuran lebih luas akan dimulai dengan pelanggan API berbayar dan pelanggan Google AI Ultra.

Coba Apidog hari ini

Sambil menunggu akses, siapkan integrasi yang dapat beralih ke Argon hanya dengan mengubah satu variabel konfigurasi. Artikel ini membedakan fakta yang sudah dikonfirmasi dari yang belum tersedia, lalu menggunakan Gemini 3.8 Flash sebagai model pengembangan untuk menguji permintaan, menyiapkan pemeriksaan go-live, membuat mock di Apidog, dan memasang batas biaya. Untuk konteks modelnya, baca apa itu Gemini 4 Argon dan tanggal rilis Gemini 4 Argon.

Apa yang telah dikonfirmasi tentang API Gemini 4 Argon, dan apa yang belum

Postingan peluncuran Google mengonfirmasi harga dan batas output. Detail integrasi lainnya masih belum dipublikasikan.

Item Status Detail
Harga input Dikonfirmasi $2 per 1 juta token saat perkenalan, $4 setelahnya
Harga output Dikonfirmasi $10 per 1 juta token saat perkenalan, $20 setelahnya
Input yang di-cache Dikonfirmasi Diskon 95%: $0,10 saat perkenalan, $0,20 standar
Batas output Dikonfirmasi Hingga 1 juta token, naik dari 64K
Antarmuka API Sinyal Dokumen Google menyatakan model baru diluncurkan di Interactions API
ID model Belum diterbitkan Tidak tercantum di halaman model, harga, atau changelog
Jendela konteks input Belum diterbitkan Evaluasi konteks panjang memakai prompt hingga 1 juta token, tetapi itu bukan spesifikasi
Tingkat pemikiran Belum diterbitkan Evaluasi memakai “pengaturan pemikiran tertinggi”; nama dan default belum diketahui
Batas kecepatan Belum diterbitkan Belum ada tingkatan yang diumumkan
Dukungan batch Belum diterbitkan Belum ada harga batch atau Flex
Tingkat prompt panjang Belum diterbitkan Aturan harga Argon untuk prompt panjang belum disebutkan
Durasi periode perkenalan Belum diterbitkan Tidak ada tanggal akhir untuk harga $2/$10

Dua detail perlu menjadi dasar desain integrasi:

  1. Dokumen API Interaksi menyatakan bahwa model baru akan diluncurkan di Interactions API. Karena Argon adalah model baru, gunakan Interactions API sebagai jalur utama. Google belum mengonfirmasi dukungan generateContent.
  2. Batas output 1 juta token adalah batas yang disebutkan Google, tetapi Vals AI mencantumkan output maksimum 262K pada konfigurasi yang diuji. Jangan mengasumsikan semua endpoint langsung mendukung 1 juta token penuh pada hari pertama.

Panduan token output 1 juta membahas dampaknya pada streaming, timeout, dan penyimpanan.

Untuk estimasi biaya, prompt 20.000 token dan output 5.000 token dihitung sebagai berikut:

Input:  20.000 × $2 / 1.000.000  = $0,04
Output:  5.000 × $10 / 1.000.000 = $0,05
Total:                              $0,09
Enter fullscreen mode Exit fullscreen mode

Dengan tarif standar $4/$20, permintaan yang sama berbiaya $0,18. Harga output perkenalan Argon ($10) berada di bawah $12 Gemini 3.1 Pro Preview, sedangkan harga standarnya sama dengan Claude Opus 5.5. Lihat rincian skenario biaya, input cache, dan respons maksimum di harga Gemini 4 Argon.

Jangan menuliskan ID model dugaan ke dalam kode

Anda mungkin menemukan string ID Argon di situs benchmark, agregator, atau pull request open-source. Anggap semuanya sebagai placeholder. Google belum mengonfirmasi ID tersebut.

Menggunakan ID tebakan dapat menghasilkan:

  • HTTP 404 saat deploy produksi.
  • Fallback senyap jika wrapper menangkap error terlalu luas.
  • Perubahan kode yang tidak perlu saat ID resmi diterbitkan.

Simpan nama model di variabel lingkungan. Gunakan Gemini 3.8 Flash sebagai default pengembangan, lalu ubah nilainya ketika ID Argon resmi tersedia.

export GEMINI_MODEL="gemini-3.8-flash"
export GEMINI_THINKING="medium"
Enter fullscreen mode Exit fullscreen mode

Siapkan kode dengan Gemini 3.8 Flash

Gemini 3.8 Flash (gemini-3.8-flash) menggunakan endpoint, header, dan bentuk respons yang diharapkan juga dipakai Argon. Harga model ini adalah $0,75/$3,75 per 1 juta token hingga 31 Desember 2026.

Simpan API key di variabel GEMINI_API_KEY, bukan di kode sumber. Lihat panduan API Gemini 3.8 Flash untuk pengaturan lengkap.

Langkah 1: Kirim permintaan ke Interactions API

Interactions API adalah API utama Google dan tersedia secara umum sejak Juni 2026. Simpan model serta tingkat pemikiran dalam konfigurasi karena tingkat Argon belum diumumkan.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"${MODEL}\",
    \"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
    \"generation_config\": {\"thinking_level\": \"${THINKING}\"}
  }"
Enter fullscreen mode Exit fullscreen mode

Contoh Python dengan SDK google-genai versi 2.3.0 atau lebih baru:

# pip install "google-genai>=2.3.0"
import os
from google import genai

MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")

client = genai.Client()  # membaca GEMINI_API_KEY dari environment

interaction = client.interactions.create(
    model=MODEL,
    input="List the retry rules a REST client should follow for HTTP 429.",
    generation_config={"thinking_level": THINKING},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Pada Gemini 3.8 Flash, nilai valid untuk thinking_level adalah:

  • low
  • medium — default
  • high

Nilai minimal akan menghasilkan HTTP 400. Baca panduan tingkat pemikiran untuk memahami trade-off biaya dan kualitas.

Untuk percakapan multi-giliran, teruskan ID respons sebelumnya melalui previous_interaction_id. Tambahkan store: false jika Anda ingin menolak penyimpanan di sisi server.

Langkah 2: Pastikan jalur generateContent tetap berfungsi

Banyak aplikasi masih menggunakan endpoint generateContent. Google menyatakan jalur ini tetap didukung, jadi pertahankan sebagai fallback.

curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"contents\": [{
      \"parts\": [{
        \"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
      }]
    }],
    \"generationConfig\": {
      \"thinkingConfig\": {
        \"thinkingLevel\": \"${THINKING}\"
      }
    }
  }"
Enter fullscreen mode Exit fullscreen mode

Perhatikan perbedaan struktur tingkat pemikiran:

API Lokasi konfigurasi
Interactions API generation_config.thinking_level
generateContent generationConfig.thinkingConfig.thinkingLevel

Jika klien Anda membungkus kedua API, gunakan Interactions API sebagai jalur default untuk model baru. Terapkan prinsip yang sama pada definisi alat dan function calling. Lihat pemanggilan fungsi Gemini 3.8 Flash.

Langkah 3: Jadwalkan pemeriksaan go-live dengan models.list

Jangan hanya menyegarkan changelog. Periksa daftar model langsung melalui API.

import os
import sys
import requests

resp = requests.get(
    "https://generativelanguage.googleapis.com/v1beta/models",
    params={"pageSize": 1000},
    headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
    timeout=30,
)

resp.raise_for_status()

hits = [
    model
    for model in resp.json().get("models", [])
    if "argon" in model["name"].lower()
]

for model in hits:
    print(
        model["name"],
        "in:", model.get("inputTokenLimit"),
        "out:", model.get("outputTokenLimit"),
        model.get("supportedGenerationMethods"),
    )

sys.exit(1 if hits else 0)  # run gagal = sinyal untuk alert
Enter fullscreen mode Exit fullscreen mode

Jalankan skrip ini setiap jam dari cron atau CI menggunakan API key yang sama dengan aplikasi produksi.

Saat panggilan dijalankan pada 1 Oktober 2026 menggunakan kunci proyek berbayar, API mengembalikan 61 model, tanpa nextPageToken, dan tidak ada nama yang mengandung argon.

Ketika Argon muncul, satu respons ini akan memberi Anda:

  • ID model resmi.
  • Nilai aktual outputTokenLimit.
  • Metode generasi yang didukung.

Langkah 4: Simulasikan respons sebelum akses Argon tersedia

Anda tidak perlu menunggu akses Argon untuk membangun klien.

  1. Simpan permintaan generateContent dari Langkah 2 di Apidog.
  2. Buat variabel lingkungan GEMINI_API_KEY dan GEMINI_MODEL.
  3. Jalankan sekali terhadap Gemini 3.8 Flash.
  4. Simpan respons aktual sebagai contoh respons endpoint.
  5. Ubah metode mock proyek menjadi Response example first melalui: Pengaturan Proyek → Pengaturan Fitur → Pengaturan Mock.
  6. Gunakan URL mock untuk menguji front end, queue worker, dan parser tanpa menghabiskan token.

Mock tersebut merepresentasikan skema respons Gemini saat ini, bukan respons Argon yang spesifik, karena Google belum menerbitkan skema Argon. Namun, pendekatan ini tetap relevan karena Argon diperkirakan menggunakan API yang sama.

Untuk menguji jalur respons besar, edit usageMetadata pada contoh respons dengan jumlah token tinggi. Pastikan sistem penagihan, batas biaya, dan peringatan Anda merespons dengan benar.

Langkah 5: Verifikasi usageMetadata dan batas biaya

Setiap respons generateContent menyertakan usageMetadata. Tambahkan post-processor Apidog berikut untuk menghitung biaya dengan tarif standar Argon.

// Apidog post-processor: harga respons menggunakan tarif standar Gemini 4 Argon
const u = pm.response.json().usageMetadata;

const IN = 4 / 1e6;   // USD per input token setelah periode perkenalan
const OUT = 20 / 1e6; // USD per output token

// Pada model Gemini saat ini, token pemikiran ditagih sebagai output.
const out = (u.candidatesTokenCount || 0) + (u.thoughtsTokenCount || 0);

const cost = u.promptTokenCount * IN + out * OUT;

pm.test("usageMetadata tersedia", () => {
  pm.expect(u).to.be.an("object");
});

pm.test("biaya di bawah $0,10 dengan tarif Argon", () => {
  pm.expect(cost).to.be.below(0.10);
});
Enter fullscreen mode Exit fullscreen mode

Tentukan batas biaya per permintaan sesuai kasus penggunaan. Batas $0,10 cocok untuk prompt pendek seperti contoh ini.

Google belum mengonfirmasi bagaimana Argon akan menagih token pemikiran. Skrip di atas menggunakan aturan Gemini saat ini: token pemikiran dihitung sebagai output. Jalankan koleksi yang sama pada Gemini 3.8 Flash sekarang dan Argon nanti untuk membandingkan jumlah token serta biaya.

FAQ

Apakah API Gemini 4 Argon sudah tersedia?

Belum untuk publik. Argon saat ini diluncurkan kepada sejumlah mitra Program Fairwind melalui Gemini Enterprise. Pelanggan API berbayar dan pelanggan Google AI Ultra akan menyusul tanpa tanggal yang diumumkan.

Apa ID model Gemini 4 Argon?

Google belum menerbitkannya. String dari situs pihak ketiga adalah placeholder. Simpan model dalam variabel lingkungan dan pantau models.list.

Berapa biaya API Gemini 4 Argon?

$2 untuk input dan $10 untuk output per 1 juta token selama periode perkenalan yang durasinya belum diumumkan. Setelah itu, harganya menjadi $4 untuk input dan $20 untuk output. Input yang di-cache mendapat diskon 95%. Lihat harga Gemini 4 Argon.

Apakah Argon akan berfungsi dengan generateContent?

Google belum mengonfirmasinya. Dokumentasi menyatakan model baru diluncurkan melalui Interactions API, jadi bangun integrasi di atas Interactions API dan perlakukan generateContent sebagai fallback.

Apakah Google AI Ultra memberi akses API?

Tidak. AI Ultra adalah langganan konsumen, bukan API key. Google menyatakan akses API akan dimulai dengan pelanggan API berbayar.

Langkah Anda selanjutnya

  1. Atur GEMINI_MODEL di semua lingkungan.
  2. Jalankan pemeriksaan models.list terjadwal.
  3. Simpan permintaan Interactions API dan generateContent.
  4. Tambahkan validasi usageMetadata serta batas biaya.
  5. Ubah satu variabel konfigurasi saat Google menerbitkan ID Argon.

Unduh Apidog untuk menyimpan permintaan, mock, dan pengujian dalam satu workspace.

Top comments (0)