Gemini 4 Argon memimpin tabel benchmark Google pada 13 dari 19 baris melawan GPT-6 Astra, Claude Opus 5.5, dan Claude Fable 5.1. Namun, faktor implementasi yang paling penting adalah ketersediaan: Astra dan Opus 5.5 dapat dibeli dan dipakai hari ini, sedangkan Argon hanya tersedia bagi peserta Program Fairwind. Google mencantumkan harga Argon sebesar $2/$10 per juta token selama periode perkenalan dan $4/$20 setelahnya—sama dengan harga Claude Opus 5.5 pada tarif standar.
Artikel ini membandingkan harga, batasan, dan benchmark keempat model. Anda juga akan melihat cara merutekan workload ke model yang tersedia sekarang, lalu membuat evaluasi prompt sendiri di Apidog. Jika belum mengenal Argon, mulai dari apa itu Gemini 4 Argon, lalu lihat panduan tanggal rilis Argon.
Harga dan batasan berdampingan
Google juga membandingkan Claude Fable 5.1. Harga berikut dihitung per 1 juta token berdasarkan pos peluncuran Google, halaman model GPT-6 Astra, dan halaman harga Anthropic.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Bisakah Anda menggunakannya hari ini? | Tidak, hanya Fairwind | Ya | Ya | Ya |
| ID model API | Tidak dipublikasikan | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| Input | $2 perkenalan, lalu $4 | $10 | $4 | $10 |
| Input cache | $0,10 perkenalan, lalu $0,20 | $1 | $0,20 | $0,25 |
| Output | $10 perkenalan, lalu $20 | $50 | $20 | $50 |
| Output maks | 1M (batas yang dinyatakan Google) | 128K | 128K (300K pada Batch, beta) | 128K |
| Jendela konteks | Tidak dipublikasikan | 1.050.000 (922K input maks) | 1M | 1M |
| Biaya tambahan prompt panjang | Tidak disebutkan | Lebih dari 272K input: 2x input dan cache, 1,5x output, pada permintaan penuh | Tidak ada | Tidak ada |
Tiga implikasi praktis:
- Argon dan Opus 5.5 memiliki harga standar yang sama. Keunggulan biaya Argon hanya berlaku selama masa perkenalan, dan Google belum mengumumkan tanggal berakhirnya.
- Astra dan Fable 5.1 lebih mahal untuk token input maupun output. Tarif input/output keduanya sekitar 2,5x tarif standar Argon dan 5x tarif perkenalan Argon.
- Batas output Argon perlu divalidasi dalam workload nyata. Google menyatakan output hingga 1 juta token, tetapi Vals AI mencantumkan output maksimum 262K untuk konfigurasi Argon yang diuji.
Untuk menghitung biaya per request, gunakan panduan harga Gemini 4 Argon.
Di mana setiap model unggul dalam tabel Google
Sebelum menggunakan angka benchmark untuk keputusan arsitektur, ingat bahwa ini adalah tabel Google. Skor Argon dilaporkan oleh Google; beberapa berasal dari evaluasi internal dan sebagian dari papan peringkat. Skor pesaing terutama berasal dari vendor atau papan peringkat publik, biasanya pada pengaturan penalaran maksimum jika tersedia.
| Siapa yang memimpin | Benchmark | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: pekerjaan pengetahuan | Indeks Vals | 68,9% | 63,1% | 65,8% | 67,0% |
| Argon: pekerjaan pengetahuan | AutomationBench | 51,3% | 41,4% | 31,4% | 42,5% |
| Argon: pekerjaan pengetahuan | Benchmark Agen Hukum Harvey | 19,6% | 5,4% | 6,7% | 3,8% |
| Argon: coding | DeepSWE v1.1 | 77,9% | 74,1% | 67,4% | 74,2% |
| Argon: konteks panjang | GraphWalks 256K hingga 1M (F1) | 84,2% | 71,8% | 65,0% | 66,8% |
| Argon: multimodal | LVBench | 91,7% | 87,5% | 79,7% | 83,7% |
| Argon: multimodal | Chartography | 71,6% | 71,0% | 46,2% | 66,3% |
| Astra | FrontierSWE v2 | 55,0% | 65,5% | 56,3% | 62,3% |
| Astra | Terminal-Bench Science 0.1 | 57,6% | 68,1% | 52,6% | 63,3% |
| Astra | OSWorld-2.0 (offline, sebagian) | 69,2% | 72,6% | tidak dilaporkan | tidak dilaporkan |
| Opus 5.5 | Terminal-bench 4.0 | 57,4% | 58,2% | 57,9% | 66,4% |
| Opus 5.5 | PostTrainBench | 45,3% | 44,3% | 40,2% | 49,3% |
| Seri | CWE-bench v1 | 68,0% | 68,0% | 58,0% | 67,0% |
Argon juga memimpin pada Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks hingga 128K, dan Agent’s Last Exam. Fable 5.1 tidak memimpin pada baris mana pun dalam tabel tersebut.
Pada CWE-bench v1, papan peringkat siber DeepMind menunjukkan seri tiga arah sebesar 68% antara Argon, Astra, dan Grok 4.7, sementara Opus 5.5 memperoleh 67%.
Dalam perbandingan Argon vs Fable 5.1, Argon mencetak skor lebih tinggi pada 15 dari 17 baris yang memiliki angka dari keduanya. Fable hanya unggul pada:
- FrontierSWE v2: 56,3% vs 55,0%
- Terminal-bench 4.0: 57,9% vs 57,4%
Lihat benchmark Claude Fable 5.1 untuk angka Anthropic dan benchmark Gemini 4 Argon untuk tabel 19 baris lengkap.
Tiga peringatan sebelum mempercayai selisih kecil
1. Angka pesaing bukan hasil uji Google
Metodologi Google menyebutkan bahwa hasil model non-Gemini “bersumber dari angka yang dilaporkan sendiri oleh penyedia kecuali disebutkan lain.” Beberapa benchmark juga berasal dari papan peringkat publik seperti Vals AI, Proximal, dan Surge.
Praktik yang disarankan: jangan gunakan selisih 1–2 poin sebagai dasar satu-satunya untuk mengganti model produksi.
2. Alat uji dan konfigurasi berbeda
Pada DeepSWE v1.1, Google menghitung skor Argon 77,9% menggunakan mini-swe-agent. Skor Astra berasal dari papan peringkat publik, sedangkan angka Anthropic berasal dari kartu sistem model.
Pada LVBench, jumlah frame video juga tidak sama:
- Gemini: 1 frame per detik
- Astra: 800 frame
- Opus 5.5: 600 frame
- Fable 5.1: 300 frame
Perbedaan seperti ini dapat memengaruhi hasil multimodal secara material.
3. Model yang sama dapat memiliki skor berbeda di grafik lain
Skor Terminal-bench 4.0 untuk Opus 5.5 berubah tergantung alat evaluasi dan pengaturan effort. Anthropic melaporkan 66,4% pada pengaturan xhigh.
Aturan praktis: jangan mencampur angka dari beberapa sumber ke dalam satu ranking tanpa menyamakan konfigurasi, tool, dan kondisi pengujian.
Apa kata evaluator pihak ketiga
Papan peringkat independen memberikan konteks yang berbeda dari tabel vendor.
Artificial Analysis menempatkan Argon di posisi #8 dari 223 entri. Namun, daftar tersebut menghitung tiap pengaturan penalaran sebagai entri terpisah. Jika dibandingkan per model:
- Argon: 53
- GPT-6 Astra: 53
- Claude Fable 5.1: 53
- Claude Sonnet 5.5: 56
- Claude Opus 5.5: 58 pada pengaturan maksimum
Artificial Analysis juga mencantumkan tingkat halusinasi Argon pada AA-Omniscience sebesar 15%, dibandingkan 51% untuk Astra pada pengaturan maksimumnya.
Di Arena, Argon berada di peringkat pertama kategori Teks dengan skor 1525, berstatus Awal, dan memiliki 4.942 suara. Opus 5.5 berada di posisi keempat. Vals AI menempatkan Argon di posisi pertama dari 41 model pada Indeks Vals.
Ada juga laporan yang perlu diperhatikan: Bloomberg melaporkan bahwa beberapa karyawan Google dengan akses awal menganggap Argon kurang memuaskan pada beberapa tugas coding dan desain front-end dibanding benchmark-nya. Google menyebut karakterisasi itu tidak akurat.
Mana yang harus dirutekan
Gunakan benchmark sebagai titik awal routing, bukan keputusan final. Untuk produksi hari ini, prioritaskan model yang sudah dapat diakses dan uji pada prompt aplikasi Anda.
| Tugas | Rute hari ini | Saat Argon diluncurkan |
|---|---|---|
| Agen otomatisasi hukum, keuangan, dan kantor | Opus 5.5 (67,0% Indeks Vals) | Uji Argon; ia memimpin empat baris pekerjaan pengetahuan |
| Agen coding yang banyak menggunakan terminal | Opus 5.5 (66,4% Terminal-bench 4.0) | Opus 5.5 masih memimpin |
| Rekayasa perangkat lunak agen | Astra (65,5% FrontierSWE v2) atau Opus 5.5 | Argon memimpin DeepSWE, tetapi tertinggal di FrontierSWE; uji keduanya |
| Penggunaan komputer dan agen GUI | Astra (72,6% OSWorld-2.0) | Astra memimpin OSWorld; Argon memimpin Agent’s Last Exam |
| Penalaran dengan prompt 256K+ token | Opus 5.5 tanpa biaya tambahan, atau Astra dengan biaya tambahan di atas 272K | Argon (84,2% GraphWalks 256K hingga 1M) |
| Pemahaman video dan grafik | Astra (87,5% LVBench) | Argon (91,7%), dengan peringatan perbedaan jumlah frame |
| Ilmu pengetahuan dan rekayasa ML | Astra untuk Terminal-Bench Science, Opus 5.5 untuk PostTrainBench | Argon memimpin LABBench 2 dan RiemannBench; uji pada data Anda |
| Respons tunggal lebih dari 128K token | Opus 5.5 pada Batch, hingga 300K dalam beta | Argon, hingga 1M menurut Google |
| Workload bervolume tinggi dan sensitif biaya | Opus 5.5 ($4/$20) | Argon $2/$10 selama periode perkenalan |
Jika biaya lebih penting daripada skor puncak, lihat perbandingan GPT-6 Sol vs Claude Opus 5.5 untuk opsi OpenAI yang lebih murah.
Bandingkan model dengan prompt Anda sendiri
Benchmark vendor tidak dapat menunjukkan bagaimana model menangani data, format respons, tool call, atau batas biaya aplikasi Anda. Buat evaluasi kecil yang dapat diulang di Apidog.
1. Buat tiga request dalam satu proyek
Siapkan request untuk:
- GPT-6 Astra
- Claude Opus 5.5
- Gemini dengan model yang menggunakan variabel
{{GEMINI_MODEL}}
Sebelum ID Argon tersedia, isi variabel tersebut dengan:
gemini-3.8-flash
Saat Argon tersedia, Anda cukup mengganti nilainya tanpa mengubah skenario pengujian.
Gunakan panduan API GPT-6 Astra dan panduan Claude Opus 5.5 untuk format request masing-masing vendor.
2. Simpan konfigurasi sebagai environment variables
Pisahkan kredensial dan input yang dapat berubah:
OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...
GEMINI_MODEL=gemini-3.8-flash
SHARED_PROMPT=...
Gunakan {{SHARED_PROMPT}} pada ketiga request agar semua model menerima input yang identik.
3. Tambahkan assertion minimum
Tambahkan assertion untuk setiap request:
- Status HTTP adalah
200 - Respons tidak kosong
- Token output berada di bawah batas aplikasi
- Biaya estimasi berada di bawah anggaran
- JSON respons sesuai schema yang diharapkan, jika aplikasi membutuhkan output terstruktur
Contoh pseudo-assertion:
assert(response.status === 200);
assert(response.body !== null);
assert(response.body.length > 0);
assert(estimatedCost <= environment.MAX_COST_PER_REQUEST);
4. Jalankan sebagai satu skenario
Jalankan ketiga request dalam satu test scenario, lalu bandingkan:
- kualitas jawaban,
- kepatuhan format,
- jumlah token output,
- latency,
- kegagalan tool call atau parsing,
- dan biaya per tugas.
Hitung biaya per request
Gunakan formula berikut:
biaya =
(input_token / 1.000.000 × tarif_input) +
(output_token / 1.000.000 × tarif_output)
Contoh request dengan 20.000 token input dan 4.000 token output:
Astra
= 20.000 × $10 / 1.000.000
+ 4.000 × $50 / 1.000.000
= $0,20 + $0,20
= $0,40
Opus 5.5
= 20.000 × $4 / 1.000.000
+ 4.000 × $20 / 1.000.000
= $0,08 + $0,08
= $0,16
Argon, tarif perkenalan
= 20.000 × $2 / 1.000.000
+ 4.000 × $10 / 1.000.000
= $0,04 + $0,04
= $0,08
Argon, tarif standar
= 20.000 × $4 / 1.000.000
+ 4.000 × $20 / 1.000.000
= $0,08 + $0,08
= $0,16
Harga per token bukan biaya per tugas. Artificial Analysis mengukur Argon sekitar 62K token output per tugas, dibanding sekitar 27K untuk Astra pada effort maksimum. Karena itu, selalu ukur token aktual pada prompt produksi Anda.
Saat Argon tersedia, ganti GEMINI_MODEL, jalankan ulang skenario yang sama, dan bandingkan hasilnya dengan Astra serta Opus 5.5.
FAQ
Apakah Gemini 4 Argon lebih baik dari GPT-6 Astra?
Keduanya seri pada skor 53 di Artificial Analysis. Dalam tabel Google, Argon mencetak skor lebih tinggi pada sebagian besar baris. Namun, Astra memenangkan FrontierSWE v2, Terminal-Bench Science 0.1, dan OSWorld-2.0—serta sudah bisa digunakan hari ini.
Gemini 4 Argon vs Claude Opus 5.5: mana yang lebih baik?
Tabel Google mengunggulkan Argon pada sebagian besar baris. Opus 5.5 menang pada Terminal-bench 4.0 dan PostTrainBench, serta memimpin Artificial Analysis dengan 58 dibanding 53. Pada tarif standar, harga keduanya sama.
Apakah Gemini 4 Argon lebih murah dari Claude Opus 5.5?
Selama periode perkenalan, Argon berharga setengah dari Opus 5.5: $2/$10 dibanding $4/$20. Setelah periode tersebut, harga daftar keduanya identik. Google belum menyebutkan kapan harga perkenalan berakhir.
Model mana yang memiliki batas output terbesar?
Argon, dengan batas hingga 1 juta token menurut Google. Namun, Vals AI mencantumkan 262K untuk konfigurasi yang diuji. Model lain membatasi output sinkron hingga 128K, kecuali Opus 5.5 pada Batch yang mendukung hingga 300K dalam beta. Lihat panduan token output 1 juta untuk dampaknya pada implementasi klien.
Bisakah saya menggunakan Gemini 4 Argon hari ini?
Hanya melalui Program Fairwind Google untuk sekelompok mitra pertahanan siber terverifikasi. Pelanggan API berbayar dan pelanggan Google AI Ultra akan menyusul, tanpa tanggal yang ditentukan.
Pilih berdasarkan beban kerja, lalu uji
Argon terlihat paling kuat pada pekerjaan pengetahuan, konteks panjang, dan benchmark multimodal. Astra menonjol pada FrontierSWE, Terminal-Bench Science, dan OSWorld. Opus 5.5 unggul pada pekerjaan terminal dan rekayasa ML, dengan harga yang akan setara dengan Argon setelah periode perkenalan berakhir.
Untuk implementasi saat ini:
- Bangun routing di atas Astra dan Opus 5.5, karena keduanya tersedia.
- Simpan model Gemini dalam environment variable.
- Gunakan prompt, assertion, dan dataset evaluasi yang sama.
- Jalankan ulang skenario saat Argon tersedia.
- Pilih berdasarkan kualitas tugas, token aktual, latency, dan biaya—bukan hanya satu skor benchmark.
Untuk menyiapkan perbandingan tiga request dalam satu proyek, unduh Apidog.
Top comments (0)