Gemini 4 Argon memimpin 13 dari 19 baris dalam tabel peluncuran Google, seri di 1 baris (CWE-bench v1, bersama GPT-6 Astra), dan tertinggal di 5 baris: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1, dan OSWorld-2.0. Kendala utamanya adalah akses: Argon saat ini hanya tersedia bagi pembela Program Fairwind, sehingga angka-angka ini belum dapat diuji ulang oleh developer di luar daftar mitra Google dan beberapa organisasi benchmark.
Di bawah ini adalah tabel lengkap, sumber pengukuran setiap baris, lima area ketika Argon kalah, catatan metodologi, skor keamanan siber, papan skor pihak ketiga, serta langkah untuk menyiapkan evaluasi Anda sendiri di Apidog sebelum akses dibuka. Untuk konteks model, mulai dari apa itu Gemini 4 Argon. Untuk evaluasi pilihan model, lihat Argon vs GPT-6 Astra vs Claude Opus 5.5.
Tabel lengkap, dengan siapa yang mengukur setiap baris
Berikut adalah hasil yang dilaporkan Google dari pos peluncuran dan PDF metodologi evaluasi, yang diberi label “hasil per Oktober 2026.”
Google menghitung sendiri 10 dari 19 skor Argon. Sembilan skor lainnya berasal dari papan peringkat publik. Angka pesaing dapat berasal dari papan peringkat, pengujian Google, kartu sistem, atau postingan blog vendor. Karena harness berbeda pada setiap baris, jangan memperlakukan seluruh tabel sebagai satu pengujian yang seragam.
Teks tebal menandai pemimpin setiap baris.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Siapa yang mengukurnya |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Papan peringkat Zapier (set pribadi) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Dihitung sendiri oleh Argon; papan peringkat Astra; kartu sistem Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Papan peringkat Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Dihitung sendiri oleh Argon; papan peringkat pesaing |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Dihitung sendiri untuk semua model |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Dihitung sendiri oleh Argon; papan peringkat pesaing |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Dihitung sendiri untuk semua model |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Papan peringkat Surge |
| GraphWalks hingga 128K | 99.7% | 98.7% | 91.4% | 90.6% | Dihitung sendiri untuk semua model |
| GraphWalks 256K hingga 1M | 84.2% | 71.8% | 65.0% | 66.8% | Dihitung sendiri untuk semua model |
| Agent’s Last Exam | 39.5% | 34.2% | t/l | 38.2% | Dihitung sendiri oleh Argon; papan peringkat pesaing |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | t/l | t/l | Dihitung sendiri oleh Argon; Astra dari postingan blog OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Papan peringkat Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Dihitung sendiri untuk semua model |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Papan peringkat publik |
t/l berarti tidak dilaporkan. Grok 4.7, yang tidak tercantum dalam tabel Google, juga mencetak 68% pada papan peringkat CWE-bench. Dengan demikian, hasil CWE-bench v1 adalah seri tiga arah.
Jika dikelompokkan berdasarkan sumber:
-
9 baris berasal dari papan peringkat publik untuk setiap model: Vals AI, Zapier, Proximal, Surge, dan CWE-bench.
- Argon memimpin 7 dari 9 baris tersebut dan seri di 1 baris.
-
5 baris dijalankan Google untuk keempat model.
- Argon memimpin 4 dari 5 baris.
-
5 baris campuran menggunakan skor Argon dari pengujian Google dan skor pesaing dari sumber lain.
- Tiga dari lima kekalahan Argon muncul di kelompok ini.
Jika penghitungan sendiri secara konsisten menguntungkan Argon, pola yang diharapkan justru sebaliknya. Karena itu, pisahkan hasil berdasarkan sumber sebelum menarik kesimpulan untuk workload Anda.
Di mana Argon tertinggal, dan mengapa itu penting untuk pengkodean agen
Berikut lima benchmark yang tidak dipimpin Argon:
- FrontierSWE v2: Argon mencetak 55.0%, dibanding 65.5% untuk Astra. Argon berada di posisi terakhir dari empat model, di belakang Fable 5.1 pada 56.3% dan Opus 5.5 pada 62.3%. Ini adalah papan peringkat yang mengevaluasi semua model.
- Terminal-bench 4.0: Argon mencetak 57.4%, dibanding 66.4% untuk Opus 5.5. Argon kembali berada di posisi terakhir, sementara Astra dan Fable 5.1 hanya berjarak sekitar satu poin.
- PostTrainBench: Argon mencetak 45.3%, dibanding 49.3% untuk Opus 5.5. Argon berada di posisi kedua pada baris yang dijalankan Google untuk semua model.
- Terminal-Bench Science 0.1: Argon mencetak 57.6%, dibanding 68.1% untuk Astra. Argon berada di posisi ketiga dan hanya unggul atas Fable 5.1. Google menjalankan upaya Argon dengan batas waktu verifikasi 6x.
- OSWorld-2.0, subset offline: Argon mencetak 69.2%, dibanding 72.6% untuk Astra. Anthropic hanya melaporkan skor gabungan online dan offline, sehingga model Claude tidak muncul pada baris ini.
Untuk pengkodean agen, hasilnya terbagi dua:
- Argon menang pada DeepSWE v1.1 dan Vibe Code Bench.
- Argon berada di posisi terakhir pada FrontierSWE v2 dan Terminal-bench 4.0.
Kemenangan DeepSWE menggunakan harness yang berbeda: Argon dijalankan pada harness agen mini-swe, angka Astra berasal dari papan peringkat publik, dan angka Claude berasal dari kartu sistem. Vibe Code Bench lebih mudah dibandingkan karena Vals AI mengevaluasi semua model, tetapi selisih Argon hanya 1.6 poin.
Jika produk Anda mengandalkan agen terminal, tugas repo berjangka panjang, atau perbaikan kode multi-file, jadikan FrontierSWE v2 dan Terminal-bench 4.0 sebagai sinyal utama. Astra memegang keunggulan pada FrontierSWE; hands-on GPT-6 Astra membahas penggunaannya saat ini. Untuk Anthropic, lihat rincian benchmark Claude Fable 5.1.
Bloomberg melaporkan bahwa karyawan Google anonim yang memiliki akses menyatakan Argon kurang memuaskan untuk beberapa pekerjaan pengkodean dan desain front-end dibandingkan dengan skor benchmark-nya. Google menyatakan bahwa karakterisasi tersebut tidak akurat.
Peringatan metodologi yang mengubah cara Anda membaca tabel
Sebelum menggunakan angka ini untuk memilih model, perhatikan detail berikut.
- Pengaturan upaya maksimal. Argon dijalankan menggunakan API Gemini dengan pengaturan pemikiran tertinggi. Untuk Astra, Fable 5.1, dan Opus 5.5, Google secara default menggunakan pengaturan pemikiran atau penalaran maksimum yang tersedia. Ini membandingkan batas atas kemampuan, bukan perilaku default, latensi, atau biaya.
- Frame LVBench berbeda. Google menjalankan LVBench sendiri untuk keempat model tanpa alat. Gemini mengambil sampel video pada 1 FPS. Astra menerima 800 frame, Fable 5.1 menerima 300, dan Opus 5.5 menerima 600 karena keterbatasan API. Input antarmodel tidak identik.
- OSWorld memakai hasil terbaik dari tiga run. Skor Argon adalah “maksimal dari 3 run dengan satu percobaan per run.” Ini adalah hasil terbaik, bukan rata-rata.
- Agent’s Last Exam memakai jendela lima jam. Argon dijalankan pada harness ALE-Claw dengan jendela waktu 5 jam.
- Filter keamanan aktif. Agent’s Last Exam dan OSWorld dijalankan dengan filter keamanan aktif. Respons yang ditandai dikembalikan sebagai string kosong. Jika filter dipicu, kondisi ini merugikan Argon.
Untuk evaluasi internal, jangan hanya menyalin metrik akhir. Catat juga:
- model dan ID versi,
- pengaturan reasoning,
- batas waktu,
- jumlah percobaan,
- tooling atau harness,
- biaya dan penggunaan token,
- apakah angka yang digunakan adalah rata-rata, median, atau hasil terbaik.
Baris siber dari halaman siber DeepMind
Halaman siber DeepMind menambahkan empat skor di luar tabel peluncuran.
| Evaluasi siber | Gemini 4 Argon | Perbandingan |
|---|---|---|
| Penemuan kerentanan dunia nyata | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Benchmark Uji Penetrasi Wiz | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
Keberhasilan serangan Gray Swan IPI (k=15, lebih rendah lebih baik) |
0.7% | Terendah di grafik; Kimi K3 tertinggi di 52.7% |
| CWE-bench v1 | 68% | Seri tiga arah dengan Grok 4.7 dan GPT-6 Astra; Opus 5.5 di 67% |
Evaluasi kerentanan memakai harness internal Antigravity yang “tidak terspesialisasi siber” dengan akses ke kode sumber. Uji Wiz memberi model “akses hanya ke situs web yang berjalan dan perilaku publiknya, tanpa kode sumber aplikasi.”
Dua perbandingan utama tersebut menggunakan model siber Google sebelumnya, bukan pesaing langsung. Untuk implikasinya pada API yang Anda jalankan, baca penjelasan pertahanan siber Argon.
Papan skor pihak ketiga
Organisasi berikut memposting skor dalam beberapa menit setelah peluncuran, sehingga mereka memiliki akses pra-rilis.
- Artificial Analysis mencantumkan Gemini 4 Argon (Tinggi) pada Indeks Kecerdasan 53, peringkat #8 dari 223. Peringkat ini menghitung setiap pengaturan penalaran secara terpisah. Berdasarkan model yang berbeda, Argon seri dengan Fable 5.1 dan GPT-6 Astra, serta berada di belakang Opus 5.5 pada 58 di pengaturan maksimum dan Sonnet 5.5 pada 56 di pengaturan maksimum. Artificial Analysis melaporkan tingkat halusinasi 15% pada AA-Omniscience, sementara Astra pada pengaturan maksimum tercatat 51%, dengan akurasi 50% dibanding 63%. Menjalankan indeks tersebut berbiaya $1.99 per tugas, dengan sekitar 62K output token per tugas dibanding sekitar 27K untuk Astra pada pengaturan maksimum. Artificial Analysis tidak menampilkan data kecepatan atau latensi.
- Vals AI menempatkan Argon pada 68.90% di Vals Index, #1 dari 41 model dan model Gemini pertama yang memuncaki papan skor tersebut, dengan biaya $15.68 per pengujian. Vals AI mencantumkan output maksimum 262K untuk konfigurasi yang diuji, di bawah 1 juta yang disebutkan Google.
- Arena menempatkan Argon #1 pada Teks dengan skor 1525, ditandai sebagai Pendahuluan dari 4.942 suara, serta #8 pada WebDev.
Mengapa media mempublikasikan 12, 13, dan 14 kemenangan
Beberapa media melaporkan jumlah kemenangan yang berbeda. Berikut penghitungan ulang dari 19 baris Google.
| Dihitung terhadap | Argon menang | Seri | Argon kalah | Tidak dilaporkan |
|---|---|---|---|---|
| Terbaik dari ketiga pesaing | 13 | 1 | 5 | 0 |
| Hanya GPT-6 Astra | 14 | 1 | 4 | 0 |
| Hanya Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Hanya Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Angka 13 benar jika dibandingkan dengan seluruh bidang. Angka 14 benar dalam perbandingan head-to-head melawan Astra atau Opus 5.5. Angka 12 tidak cocok dengan kerangka penghitungan mana pun dari 19 baris ini, jadi periksa benchmark yang dihitung oleh sumber tersebut.
Selain jumlah kemenangan, perhatikan margin:
- Harvey Legal Agent: 19.6% vs 6.7%, selisih besar.
- Chartography: 71.6% vs 71.0%, selisih hanya 0.6 poin.
Jumlah kemenangan tanpa konteks margin dapat menyembunyikan perbedaan praktis.
Cara menjalankan evaluasi Anda sendiri pada hari akses dibuka
Benchmark menjelaskan harness Google. Prompt Anda menjelaskan produk Anda.
Siapkan evaluasi sekarang dengan model yang sudah dapat dipanggil, lalu arahkan skenario yang sama ke Argon saat akses tersedia.
1. Pilih tugas nyata
Gunakan prompt dan data yang mewakili workload produksi Anda, misalnya:
- perbaikan bug pada repositori,
- tugas terminal multi-langkah,
- ekstraksi data dari dokumen panjang,
- pembuatan atau validasi payload API,
- perubahan komponen front-end,
- analisis log dan insiden.
Jangan hanya memakai satu prompt. Buat set kecil yang mencakup tugas mudah, menengah, dan sulit.
2. Buat environment model
Di Apidog, buat environment dengan variabel berikut:
GEMINI_API_KEY=your-api-key
GEMINI_MODEL=gemini-3.8-flash
Google belum mempublikasikan ID model Argon. Dengan memakai variabel GEMINI_MODEL, Anda hanya perlu mengganti satu nilai saat ID Argon tersedia.
3. Parameterisasi request
Simpan setiap prompt sebagai request yang membaca model dari environment:
{
"model": "{{GEMINI_MODEL}}",
"contents": [
{
"role": "user",
"parts": [
{
"text": "{{PROMPT}}"
}
]
}
]
}
Kelompokkan request berdasarkan skenario, misalnya:
01-repo-fix/
02-terminal-task/
03-long-context/
04-api-validation/
05-frontend-task/
4. Tambahkan assertion untuk hasil dan biaya
Validasi bukan hanya HTTP status. Tambahkan assertion untuk:
- status respons,
- field respons wajib,
- konten atau struktur output yang diharapkan,
- penggunaan token pada
usageMetadata, - batas atas
thoughtsTokenCountyang sesuai dengan anggaran Anda.
Contoh assertion konseptual:
pm.test("Status harus 200", () => {
pm.response.to.have.status(200);
});
const body = pm.response.json();
pm.test("Respons memiliki output", () => {
pm.expect(body).to.have.property("candidates");
});
pm.test("Thought token tidak melebihi batas", () => {
const maxThoughtTokens = 50000;
const used = body.usageMetadata?.thoughtsTokenCount ?? 0;
pm.expect(used).to.be.at.most(maxThoughtTokens);
});
Sesuaikan nama field dengan format respons API yang Anda gunakan.
5. Jalankan baseline sekarang
Jalankan semua skenario pada Gemini 3.8 Flash sekarang dan simpan laporan sebagai baseline. Rekam minimal:
| Metrik | Contoh yang dicatat |
|---|---|
| Keberhasilan tugas | Lulus/gagal per skenario |
| Kualitas output | Skor reviewer atau assertion |
| Latensi | Waktu respons per request |
| Token | Input, output, dan thought tokens |
| Biaya | Estimasi biaya per tugas |
| Kegagalan | Timeout, output kosong, format salah, atau error tool |
Saat ID Argon tersedia, ubah satu variabel:
GEMINI_MODEL=<id-model-argon-yang-dipublikasikan>
Kemudian jalankan ulang skenario yang sama dengan input, assertion, batas waktu, dan jumlah percobaan yang sama.
Google menyatakan bahwa “semua model baru” akan diluncurkan di Interactions API. Karena itu, simpan juga versi Interactions dari setiap request. Perbandingan Argon vs Gemini 3.8 Flash membahas ekspektasi harga dan batasannya.
FAQ
Apakah benchmark Gemini 4 Argon diverifikasi secara independen?
Sebagian. Sembilan dari 19 baris berasal dari papan peringkat publik untuk setiap model, dan Artificial Analysis, Vals AI, serta Arena memposting hasilnya sendiri. Sisanya dijalankan Google untuk Argon.Berapa skor DeepSWE Gemini 4 Argon?
Argon mencetak 77.9% pada DeepSWE v1.1, mengungguli Opus 5.5 pada 74.2% dan Astra pada 74.1%. Pengujian Argon memakai harness agen mini-swe, sementara angka pesaing berasal dari papan peringkat dan kartu sistem.Apakah Argon mengalahkan GPT-6 Astra pada benchmark?
Dalam tabel Google secara head-to-head, Argon menang pada 14 baris, seri pada 1 baris, dan kalah pada 4 baris. Pada Artificial Analysis, keduanya seri di skor 53.Bisakah saya mengulang benchmark ini sendiri?
Belum. Argon terbatas untuk mitra Fairwind dan Google belum memberi tanggal rilis publik. Pelacak tanggal rilis Argon mengikuti perkembangan peluncurannya.
Langkah selanjutnya
Buat skenario evaluasi sekarang, jalankan pada Gemini 3.8 Flash, dan simpan laporannya. Saat Argon dibuka, Anda dapat menukar variabel model dan memperoleh perbandingan yang relevan dengan produk Anda dalam beberapa menit.
Unduh Apidog untuk mulai menyiapkan skenario pengujian.
Top comments (0)