Gemini 3.8 Flash tersedia hari ini sebagai model stabil dengan tingkat gratis. Harganya $0,75 untuk input dan $3,75 untuk output per 1 juta token hingga 31-12-2026, lalu $1,50 dan $7,50, dengan batas output 64K. Gemini 4 Argon belum tersedia secara umum. Posting peluncuran Google mencantumkan harga perkenalan $2 untuk input dan $10 untuk output, lalu $4 dan $20 setelah periode perkenalan yang tanggal akhirnya belum diumumkan. Google menyatakan batas output Argon mencapai 1 juta token, tetapi saat ini hanya tersedia untuk pembela Program Fairwind. Jika Anda perlu rilis kuartal ini, gunakan Flash dan siapkan Argon agar nanti cukup diaktifkan lewat satu perubahan konfigurasi.
Artikel ini membandingkan spesifikasi, benchmark yang dibagikan dalam kedua posting peluncuran, skor siber, dan biaya untuk panggilan identik. Di akhir, Anda akan menyiapkan request yang dapat beralih model lewat satu variabel. Untuk konteks, baca apa itu Gemini 4 Argon dan apa itu Gemini 3.8 Flash.
Perbandingan: model yang dapat Anda panggil hari ini
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Ketersediaan | Stabil di Gemini API, AI Studio, Antigravity, dan Gemini Enterprise | Subset mitra Program Fairwind sebagai model terkelola di Gemini Enterprise |
| ID model | gemini-3.8-flash |
Belum dipublikasikan |
| Harga per 1 juta token (input / output) | $0,75 / $3,75 hingga 31-12-2026, lalu $1,50 / $7,50 | $2 / $10 saat perkenalan, lalu $4 / $20 |
| Input cache per 1 juta token | $0,075, lalu $0,15 | $0,10 saat perkenalan, lalu $0,20 |
| Batas output | 65.536 token | 1 juta token menurut Google |
| Jendela input | 1.048.576 token | Belum dipublikasikan |
| Tingkat pemikiran |
low, medium (default), high; minimal menghasilkan HTTP 400 |
Belum didokumentasikan |
| Tingkat API gratis | Ya, dengan batas laju | Belum diumumkan |
| Akses konsumen | Aplikasi Gemini di AI Pro dan Ultra, serta Mode AI di Search | Belum tersedia; pelanggan AI Ultra disebut sebagai gelombang pertama tanpa tanggal |
Beberapa detail perlu diperlakukan dengan hati-hati:
- Google belum mempublikasikan jendela input Argon, walaupun evaluasi konteks panjangnya menggunakan prompt hingga 1 juta token.
- Google menyatakan batas output Argon adalah 1 juta token. Namun, evaluator pihak ketiga Vals AI mencantumkan output maksimum 262K untuk konfigurasi yang diuji.
- Evaluasi Argon berjalan dengan “pengaturan pemikiran tertinggi”. Kemungkinan ada tingkat tinggi, tetapi Google belum mendokumentasikan nama tingkat atau nilai defaultnya.
- Tingkat Flash tersedia di dokumentasi pemikiran Google dan panduan tingkat pemikiran Gemini 3.8 Flash.
Tingkat gratis Flash memiliki batas laju, dan Google menyatakan data dari tingkat gratis “digunakan untuk meningkatkan produk kami”. Google belum mengumumkan akses gratis untuk Argon. Lihat penjelasan akses gratis Argon untuk alternatif yang dapat digunakan sekarang.
Benchmark yang dibagikan dalam kedua posting peluncuran
Kedua tabel peluncuran Google membagikan dua benchmark berikut. Angka ini dilaporkan oleh Google, sementara metodologi Argon mengaitkan kedua benchmark tersebut dengan Vals AI.
| Benchmark | Gemini 3.8 Flash | Gemini 4 Argon |
|---|---|---|
| Vals Finance Agent v2 | 61,4% | 65,4% |
| Harvey Legal Agent Benchmark | 10,0% | 19,6% |
Google mempublikasikan tabel tersebut terpaut satu bulan dan membandingkannya dengan kelompok pesaing yang berbeda. Jadi, perlakukan selisihnya sebagai indikator arah, bukan uji terkontrol.
Namun, dua hal terlihat jelas:
- Pada benchmark hukum, Argon mencapai 19,6%, hampir dua kali skor Flash sebesar 10,0%.
- Pada benchmark keuangan, Argon unggul 4 poin: 65,4% dibanding 61,4%.
Benchmark lain pada tabel Argon tidak memiliki padanan Gemini 3.8 Flash di teks peluncuran. Tabel Flash memuat HLE-Verified, yang tidak muncul di Argon, sedangkan skor DeepSWE Flash hanya tersedia dalam gambar kartu model.
Di Text Arena, papan peringkat pihak ketiga, Argon dengan pengaturan tinggi berada di posisi #1 pada voting awal. Gemini 3.8 Flash dengan pengaturan tinggi berada di posisi #11. Lihat rincian benchmark Argon untuk tabel lengkap 19 baris dan sumber pengukurannya.
Siber: Argon vs Gemini 3.8 Flash Cyber
Halaman siber DeepMind membandingkan Argon dengan Gemini 3.8 Flash Cyber, varian Flash yang dibatasi Fairwind.
| Evaluasi siber | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Penemuan kerentanan dunia nyata | 85,8% | 71,0% |
| Wiz Penetration Test Benchmark | 70,9% | 58,2% |
Kedua model tersebut memiliki batas akses:
- Gemini 3.8 Flash Cyber tersedia secara umum di belakang daftar izin pada Gemini Enterprise Agent Platform.
- Argon hanya tersedia untuk Fairwind.
Jika Anda bukan mitra Fairwind, angka benchmark tidak mengubah model yang dapat dipanggil sekarang: Gemini 3.8 Flash umum adalah pilihan yang bisa langsung digunakan untuk membangun aplikasi.
Hitung biaya untuk panggilan yang sama
Gunakan contoh panggilan berikut:
- Input: 100.000 token
- Output: 8.000 token
- Token pemikiran sudah termasuk dalam output 8.000 token untuk Gemini 3.8 Flash
Google belum menjelaskan cara Argon menagih token pemikiran. Perhitungan Argon berikut mengasumsikan model tersebut mengikuti pola penagihan Gemini saat ini.
| Model dan periode | Biaya input | Biaya output | Total per panggilan |
|---|---|---|---|
| Gemini 3.8 Flash, perkenalan | 0,1 juta × $0,75 = $0,075 | 0,008 juta × $3,75 = $0,030 | $0,105 |
| Gemini 3.8 Flash, mulai 01-01-2027 | 0,1 juta × $1,50 = $0,150 | 0,008 juta × $7,50 = $0,060 | $0,210 |
| Gemini 4 Argon, perkenalan | 0,1 juta × $2 = $0,200 | 0,008 juta × $10 = $0,080 | $0,280 |
| Gemini 4 Argon, standar | 0,1 juta × $4 = $0,400 | 0,008 juta × $20 = $0,160 | $0,560 |
Tarif per token Argon adalah 8/3, atau sekitar 2,67 kali tarif Flash, baik pada harga perkenalan maupun harga standar.
Jika menjalankan 1.000 panggilan seperti contoh tersebut per hari:
- Flash pada tarif perkenalan: $105/hari
- Argon pada tarif perkenalan: $280/hari
Perhatikan tiga faktor yang dapat mengubah rasio ini.
Jumlah token antarmodel tidak akan selalu sama.
Prompt identik dapat menghasilkan output dan token pemikiran yang berbeda. Evaluasi Argon menggunakan pengaturan pemikiran tertinggi. Pada Flash, Google juga memperingatkan bahwa tingkat upaya lebih tinggi dapat menggunakan lebih banyak token.Output panjang mengubah arsitektur request.
Respons 200.000 token tidak muat dalam batas Flash 65.536 token, sehingga harus dipecah menjadi beberapa panggilan. Di bawah batas output Argon yang dinyatakan Google, respons tersebut dapat dikirim dalam satu request.
Untuk output 200.000 token pada tarif perkenalan Argon:
0,2 juta × $10 = $2,00
Pada harga standar:
0,2 juta × $20 = $4,00
Output penuh 1 juta token berbiaya $10 pada tarif perkenalan atau $20 pada harga standar.
- Tanggal akhir harga perkenalan Argon belum diketahui. Harga perkenalan Flash berakhir pada 31-12-2026. Google belum mengumumkan kapan harga perkenalan Argon berakhir.
Flash juga memiliki Batch dengan diskon 50%: $0,375 untuk input dan $1,875 untuk output hingga 31 Desember, menurut halaman harga Gemini API. Google belum mempublikasikan harga Batch untuk Argon.
Untuk perhitungan lebih rinci, lihat panduan harga Argon dan panduan harga Gemini 3.8 Flash.
Kapan harus memakai Flash, dan kapan merencanakan Argon?
Luncurkan dengan Gemini 3.8 Flash sekarang jika
-
Anda dibatasi biaya. Flash berbiaya
3/8dari Argon per token, dan Batch dapat mengurangi biaya itu hingga setengahnya. - Anda menangani volume tinggi. Klasifikasi, ekstraksi, routing, dan chat dalam skala besar cepat menjadi mahal pada tarif $10 per 1 juta token output.
- Anda harus mulai hari ini. Flash memiliki ID model stabil, tingkat gratis untuk prototyping, dan jadwal harga yang dipublikasikan.
- Output Anda muat dalam 65.536 token. Sebagian besar workload API berada dalam batas ini.
Rencanakan Argon jika
- Pekerjaan Anda memiliki horizon panjang. Google menyatakan Argon dibangun untuk mempertahankan penalaran mendalam di seluruh workflow kompleks dan berhorizon panjang.
- Anda membutuhkan output lebih dari 64K token. Contohnya penulisan ulang modul penuh, laporan panjang, atau migrasi besar.
- Anda menjalankan agen hukum atau keuangan. Ini adalah dua benchmark yang memuat kedua model, dan Argon memimpin pada keduanya.
- Anda adalah pembela Fairwind yang memenuhi syarat. Argon saat ini merupakan model unggulan program tersebut.
Anda tidak perlu memilih satu model untuk semua traffic. Gunakan Flash sebagai default, lalu arahkan request yang benar-benar sulit ke Argon saat aksesnya tersedia.
Implementasi: satu request tersimpan, dua model
Simpan nama model dalam variabel lingkungan. Jalankan request produksi pada Gemini 3.8 Flash sekarang, lalu ubah variabel ketika ID model Argon dipublikasikan.
Jangan menebak ID model Argon sebelum Google menerbitkannya.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "Summarize this contract clause in 3 bullets."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
},
"maxOutputTokens": 8192
}
}'
Gunakan konfigurasi lingkungan berikut:
export GEMINI_API_KEY="your-api-key"
export GEMINI_MODEL="gemini-3.8-flash"
Saat Argon tersedia, perubahan utamanya seharusnya hanya:
export GEMINI_MODEL="ID_MODEL_ARGON_YANG_DITERBITKAN_GOOGLE"
Setiap respons generateContent berakhir dengan usageMetadata. Di Apidog, simpan GEMINI_API_KEY dan GEMINI_MODEL sebagai environment variables, lalu simpan request ini sebagai baseline.
Tambahkan assertion berikut ke skenario pengujian Anda:
- Status respons adalah
200 - Field respons yang dibaca aplikasi tersedia
-
usageMetadata.thoughtsTokenCounttidak melewati batas biaya Anda -
maxOutputTokenstetap dibatasi agar respons panjang tidak menghabiskan anggaran
Praktik yang disarankan:
- Jalankan request pada Flash.
- Simpan output dan
usageMetadata. - Simpan laporan pengujian sebagai baseline.
- Saat Argon tersedia, ganti satu variabel.
- Jalankan skenario yang sama.
- Bandingkan output, latency, dan penggunaan token secara berdampingan.
Siapkan juga versi Interactions API
Ada dua peringatan untuk hari peluncuran Argon:
- Google menyatakan bahwa “semua model baru” akan diluncurkan di Interactions API.
- Google belum menyatakan apakah Argon mendukung
generateContent.
Karena itu, simpan juga request Interactions API di samping request generateContent:
POST https://generativelanguage.googleapis.com/v1beta/interactions
Untuk Interactions API, konfigurasi tingkat pemikiran menggunakan:
generation_config.thinking_level
Nama tingkat pemikiran Argon belum didokumentasikan. Karena itu, nilai medium yang digunakan oleh Flash mungkin tidak berlaku untuk Argon. Setelah Argon tersedia, uji konfigurasi yang didokumentasikan Google dan bandingkan penggunaan tokennya dengan baseline Flash.
FAQ
Apakah Gemini 4 Argon lebih baik daripada Gemini 3.8 Flash?
Pada dua benchmark yang dibagikan dalam kedua tabel peluncuran, ya. Argon mendapat 65,4% dibanding 61,4% pada Vals Finance Agent v2, serta 19,6% dibanding 10,0% pada Harvey Legal Agent Benchmark. Namun, Argon sekitar 2,67 kali lebih mahal per token dan belum dapat dipanggil secara umum.
Haruskah saya menunggu Gemini 4 Argon?
Tidak jika Anda perlu rilis sekarang. Google belum memberikan tanggal rilis, hanya menyebut “sesegera mungkin”, dimulai dari pelanggan API berbayar dan pelanggan AI Ultra.
Gemini 3.8 Flash atau Argon untuk proyek baru?
Mulai dengan Gemini 3.8 Flash dan simpan model dalam environment variable. Setelah Argon tersedia, pindahkan request yang membutuhkan output panjang atau kemampuan hukum dan keuangan yang lebih dalam setelah diuji menggunakan prompt nyata Anda.
Apakah ada cara gratis untuk menggunakan Argon?
Tidak. Google belum mengumumkan tingkat gratis. Lihat penjelasan akses gratis Argon untuk model Gemini gratis yang dapat digunakan hari ini.
Apakah Argon menggantikan Gemini 3.8 Flash?
Google belum menyatakannya. Google menyebut Argon sebagai model perbatasan baru, dan Reuters melaporkan ukurannya lebih besar daripada lini Pro sebelumnya. Artinya, Argon berada pada tingkat berbeda dari Flash, bukan sekadar pengganti langsung.
Langkah selanjutnya
Siapkan request hari ini, jalankan pada Gemini 3.8 Flash, dan simpan laporannya. Ketika Argon diluncurkan, Anda dapat mengetahui dalam beberapa menit apakah peningkatan kualitasnya sepadan dengan biaya untuk traffic Anda.
Unduh Apidog untuk membuat, menguji, dan membandingkan request kedua model.
Top comments (0)