DEV Community

Cover image for Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5
Walse
Walse

Posted on Originally published at apidog.com

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

Gemini 4 Argon memimpin tabel benchmark Google pada 13 dari 19 baris melawan GPT-6 Astra, Claude Opus 5.5, dan Claude Fable 5.1. Namun, faktor implementasi yang paling penting adalah ketersediaan: Astra dan Opus 5.5 dapat dibeli dan dipakai hari ini, sedangkan Argon hanya tersedia bagi peserta Program Fairwind. Google mencantumkan harga Argon sebesar $2/$10 per juta token selama periode perkenalan dan $4/$20 setelahnya—sama dengan harga Claude Opus 5.5 pada tarif standar.

Coba Apidog hari ini

Artikel ini membandingkan harga, batasan, dan benchmark keempat model. Anda juga akan melihat cara merutekan workload ke model yang tersedia sekarang, lalu membuat evaluasi prompt sendiri di Apidog. Jika belum mengenal Argon, mulai dari apa itu Gemini 4 Argon, lalu lihat panduan tanggal rilis Argon.

Harga dan batasan berdampingan

Google juga membandingkan Claude Fable 5.1. Harga berikut dihitung per 1 juta token berdasarkan pos peluncuran Google, halaman model GPT-6 Astra, dan halaman harga Anthropic.

Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
Bisakah Anda menggunakannya hari ini? Tidak, hanya Fairwind Ya Ya Ya
ID model API Tidak dipublikasikan gpt-6-astra claude-opus-5-5 claude-fable-5-1
Input $2 perkenalan, lalu $4 $10 $4 $10
Input cache $0,10 perkenalan, lalu $0,20 $1 $0,20 $0,25
Output $10 perkenalan, lalu $20 $50 $20 $50
Output maks 1M (batas yang dinyatakan Google) 128K 128K (300K pada Batch, beta) 128K
Jendela konteks Tidak dipublikasikan 1.050.000 (922K input maks) 1M 1M
Biaya tambahan prompt panjang Tidak disebutkan Lebih dari 272K input: 2x input dan cache, 1,5x output, pada permintaan penuh Tidak ada Tidak ada

Tiga implikasi praktis:

  1. Argon dan Opus 5.5 memiliki harga standar yang sama. Keunggulan biaya Argon hanya berlaku selama masa perkenalan, dan Google belum mengumumkan tanggal berakhirnya.
  2. Astra dan Fable 5.1 lebih mahal untuk token input maupun output. Tarif input/output keduanya sekitar 2,5x tarif standar Argon dan 5x tarif perkenalan Argon.
  3. Batas output Argon perlu divalidasi dalam workload nyata. Google menyatakan output hingga 1 juta token, tetapi Vals AI mencantumkan output maksimum 262K untuk konfigurasi Argon yang diuji.

Untuk menghitung biaya per request, gunakan panduan harga Gemini 4 Argon.

Di mana setiap model unggul dalam tabel Google

Sebelum menggunakan angka benchmark untuk keputusan arsitektur, ingat bahwa ini adalah tabel Google. Skor Argon dilaporkan oleh Google; beberapa berasal dari evaluasi internal dan sebagian dari papan peringkat. Skor pesaing terutama berasal dari vendor atau papan peringkat publik, biasanya pada pengaturan penalaran maksimum jika tersedia.

Siapa yang memimpin Benchmark Argon Astra Fable 5.1 Opus 5.5
Argon: pekerjaan pengetahuan Indeks Vals 68,9% 63,1% 65,8% 67,0%
Argon: pekerjaan pengetahuan AutomationBench 51,3% 41,4% 31,4% 42,5%
Argon: pekerjaan pengetahuan Benchmark Agen Hukum Harvey 19,6% 5,4% 6,7% 3,8%
Argon: coding DeepSWE v1.1 77,9% 74,1% 67,4% 74,2%
Argon: konteks panjang GraphWalks 256K hingga 1M (F1) 84,2% 71,8% 65,0% 66,8%
Argon: multimodal LVBench 91,7% 87,5% 79,7% 83,7%
Argon: multimodal Chartography 71,6% 71,0% 46,2% 66,3%
Astra FrontierSWE v2 55,0% 65,5% 56,3% 62,3%
Astra Terminal-Bench Science 0.1 57,6% 68,1% 52,6% 63,3%
Astra OSWorld-2.0 (offline, sebagian) 69,2% 72,6% tidak dilaporkan tidak dilaporkan
Opus 5.5 Terminal-bench 4.0 57,4% 58,2% 57,9% 66,4%
Opus 5.5 PostTrainBench 45,3% 44,3% 40,2% 49,3%
Seri CWE-bench v1 68,0% 68,0% 58,0% 67,0%

Argon juga memimpin pada Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks hingga 128K, dan Agent’s Last Exam. Fable 5.1 tidak memimpin pada baris mana pun dalam tabel tersebut.

Pada CWE-bench v1, papan peringkat siber DeepMind menunjukkan seri tiga arah sebesar 68% antara Argon, Astra, dan Grok 4.7, sementara Opus 5.5 memperoleh 67%.

Dalam perbandingan Argon vs Fable 5.1, Argon mencetak skor lebih tinggi pada 15 dari 17 baris yang memiliki angka dari keduanya. Fable hanya unggul pada:

  • FrontierSWE v2: 56,3% vs 55,0%
  • Terminal-bench 4.0: 57,9% vs 57,4%

Lihat benchmark Claude Fable 5.1 untuk angka Anthropic dan benchmark Gemini 4 Argon untuk tabel 19 baris lengkap.

Tiga peringatan sebelum mempercayai selisih kecil

1. Angka pesaing bukan hasil uji Google

Metodologi Google menyebutkan bahwa hasil model non-Gemini “bersumber dari angka yang dilaporkan sendiri oleh penyedia kecuali disebutkan lain.” Beberapa benchmark juga berasal dari papan peringkat publik seperti Vals AI, Proximal, dan Surge.

Praktik yang disarankan: jangan gunakan selisih 1–2 poin sebagai dasar satu-satunya untuk mengganti model produksi.

2. Alat uji dan konfigurasi berbeda

Pada DeepSWE v1.1, Google menghitung skor Argon 77,9% menggunakan mini-swe-agent. Skor Astra berasal dari papan peringkat publik, sedangkan angka Anthropic berasal dari kartu sistem model.

Pada LVBench, jumlah frame video juga tidak sama:

  • Gemini: 1 frame per detik
  • Astra: 800 frame
  • Opus 5.5: 600 frame
  • Fable 5.1: 300 frame

Perbedaan seperti ini dapat memengaruhi hasil multimodal secara material.

3. Model yang sama dapat memiliki skor berbeda di grafik lain

Skor Terminal-bench 4.0 untuk Opus 5.5 berubah tergantung alat evaluasi dan pengaturan effort. Anthropic melaporkan 66,4% pada pengaturan xhigh.

Aturan praktis: jangan mencampur angka dari beberapa sumber ke dalam satu ranking tanpa menyamakan konfigurasi, tool, dan kondisi pengujian.

Apa kata evaluator pihak ketiga

Papan peringkat independen memberikan konteks yang berbeda dari tabel vendor.

Artificial Analysis menempatkan Argon di posisi #8 dari 223 entri. Namun, daftar tersebut menghitung tiap pengaturan penalaran sebagai entri terpisah. Jika dibandingkan per model:

  • Argon: 53
  • GPT-6 Astra: 53
  • Claude Fable 5.1: 53
  • Claude Sonnet 5.5: 56
  • Claude Opus 5.5: 58 pada pengaturan maksimum

Artificial Analysis juga mencantumkan tingkat halusinasi Argon pada AA-Omniscience sebesar 15%, dibandingkan 51% untuk Astra pada pengaturan maksimumnya.

Di Arena, Argon berada di peringkat pertama kategori Teks dengan skor 1525, berstatus Awal, dan memiliki 4.942 suara. Opus 5.5 berada di posisi keempat. Vals AI menempatkan Argon di posisi pertama dari 41 model pada Indeks Vals.

Ada juga laporan yang perlu diperhatikan: Bloomberg melaporkan bahwa beberapa karyawan Google dengan akses awal menganggap Argon kurang memuaskan pada beberapa tugas coding dan desain front-end dibanding benchmark-nya. Google menyebut karakterisasi itu tidak akurat.

Mana yang harus dirutekan

Gunakan benchmark sebagai titik awal routing, bukan keputusan final. Untuk produksi hari ini, prioritaskan model yang sudah dapat diakses dan uji pada prompt aplikasi Anda.

Tugas Rute hari ini Saat Argon diluncurkan
Agen otomatisasi hukum, keuangan, dan kantor Opus 5.5 (67,0% Indeks Vals) Uji Argon; ia memimpin empat baris pekerjaan pengetahuan
Agen coding yang banyak menggunakan terminal Opus 5.5 (66,4% Terminal-bench 4.0) Opus 5.5 masih memimpin
Rekayasa perangkat lunak agen Astra (65,5% FrontierSWE v2) atau Opus 5.5 Argon memimpin DeepSWE, tetapi tertinggal di FrontierSWE; uji keduanya
Penggunaan komputer dan agen GUI Astra (72,6% OSWorld-2.0) Astra memimpin OSWorld; Argon memimpin Agent’s Last Exam
Penalaran dengan prompt 256K+ token Opus 5.5 tanpa biaya tambahan, atau Astra dengan biaya tambahan di atas 272K Argon (84,2% GraphWalks 256K hingga 1M)
Pemahaman video dan grafik Astra (87,5% LVBench) Argon (91,7%), dengan peringatan perbedaan jumlah frame
Ilmu pengetahuan dan rekayasa ML Astra untuk Terminal-Bench Science, Opus 5.5 untuk PostTrainBench Argon memimpin LABBench 2 dan RiemannBench; uji pada data Anda
Respons tunggal lebih dari 128K token Opus 5.5 pada Batch, hingga 300K dalam beta Argon, hingga 1M menurut Google
Workload bervolume tinggi dan sensitif biaya Opus 5.5 ($4/$20) Argon $2/$10 selama periode perkenalan

Jika biaya lebih penting daripada skor puncak, lihat perbandingan GPT-6 Sol vs Claude Opus 5.5 untuk opsi OpenAI yang lebih murah.

Bandingkan model dengan prompt Anda sendiri

Benchmark vendor tidak dapat menunjukkan bagaimana model menangani data, format respons, tool call, atau batas biaya aplikasi Anda. Buat evaluasi kecil yang dapat diulang di Apidog.

1. Buat tiga request dalam satu proyek

Siapkan request untuk:

  • GPT-6 Astra
  • Claude Opus 5.5
  • Gemini dengan model yang menggunakan variabel {{GEMINI_MODEL}}

Sebelum ID Argon tersedia, isi variabel tersebut dengan:

gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

Saat Argon tersedia, Anda cukup mengganti nilainya tanpa mengubah skenario pengujian.

Gunakan panduan API GPT-6 Astra dan panduan Claude Opus 5.5 untuk format request masing-masing vendor.

2. Simpan konfigurasi sebagai environment variables

Pisahkan kredensial dan input yang dapat berubah:

OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...

GEMINI_MODEL=gemini-3.8-flash
SHARED_PROMPT=...
Enter fullscreen mode Exit fullscreen mode

Gunakan {{SHARED_PROMPT}} pada ketiga request agar semua model menerima input yang identik.

3. Tambahkan assertion minimum

Tambahkan assertion untuk setiap request:

  • Status HTTP adalah 200
  • Respons tidak kosong
  • Token output berada di bawah batas aplikasi
  • Biaya estimasi berada di bawah anggaran
  • JSON respons sesuai schema yang diharapkan, jika aplikasi membutuhkan output terstruktur

Contoh pseudo-assertion:

assert(response.status === 200);
assert(response.body !== null);
assert(response.body.length > 0);
assert(estimatedCost <= environment.MAX_COST_PER_REQUEST);
Enter fullscreen mode Exit fullscreen mode

4. Jalankan sebagai satu skenario

Jalankan ketiga request dalam satu test scenario, lalu bandingkan:

  • kualitas jawaban,
  • kepatuhan format,
  • jumlah token output,
  • latency,
  • kegagalan tool call atau parsing,
  • dan biaya per tugas.

Hitung biaya per request

Gunakan formula berikut:

biaya =
(input_token / 1.000.000 × tarif_input) +
(output_token / 1.000.000 × tarif_output)
Enter fullscreen mode Exit fullscreen mode

Contoh request dengan 20.000 token input dan 4.000 token output:

Astra
= 20.000 × $10 / 1.000.000
+ 4.000 × $50 / 1.000.000
= $0,20 + $0,20
= $0,40
Enter fullscreen mode Exit fullscreen mode
Opus 5.5
= 20.000 × $4 / 1.000.000
+ 4.000 × $20 / 1.000.000
= $0,08 + $0,08
= $0,16
Enter fullscreen mode Exit fullscreen mode
Argon, tarif perkenalan
= 20.000 × $2 / 1.000.000
+ 4.000 × $10 / 1.000.000
= $0,04 + $0,04
= $0,08
Enter fullscreen mode Exit fullscreen mode
Argon, tarif standar
= 20.000 × $4 / 1.000.000
+ 4.000 × $20 / 1.000.000
= $0,08 + $0,08
= $0,16
Enter fullscreen mode Exit fullscreen mode

Harga per token bukan biaya per tugas. Artificial Analysis mengukur Argon sekitar 62K token output per tugas, dibanding sekitar 27K untuk Astra pada effort maksimum. Karena itu, selalu ukur token aktual pada prompt produksi Anda.

Saat Argon tersedia, ganti GEMINI_MODEL, jalankan ulang skenario yang sama, dan bandingkan hasilnya dengan Astra serta Opus 5.5.

FAQ

Apakah Gemini 4 Argon lebih baik dari GPT-6 Astra?

Keduanya seri pada skor 53 di Artificial Analysis. Dalam tabel Google, Argon mencetak skor lebih tinggi pada sebagian besar baris. Namun, Astra memenangkan FrontierSWE v2, Terminal-Bench Science 0.1, dan OSWorld-2.0—serta sudah bisa digunakan hari ini.

Gemini 4 Argon vs Claude Opus 5.5: mana yang lebih baik?

Tabel Google mengunggulkan Argon pada sebagian besar baris. Opus 5.5 menang pada Terminal-bench 4.0 dan PostTrainBench, serta memimpin Artificial Analysis dengan 58 dibanding 53. Pada tarif standar, harga keduanya sama.

Apakah Gemini 4 Argon lebih murah dari Claude Opus 5.5?

Selama periode perkenalan, Argon berharga setengah dari Opus 5.5: $2/$10 dibanding $4/$20. Setelah periode tersebut, harga daftar keduanya identik. Google belum menyebutkan kapan harga perkenalan berakhir.

Model mana yang memiliki batas output terbesar?

Argon, dengan batas hingga 1 juta token menurut Google. Namun, Vals AI mencantumkan 262K untuk konfigurasi yang diuji. Model lain membatasi output sinkron hingga 128K, kecuali Opus 5.5 pada Batch yang mendukung hingga 300K dalam beta. Lihat panduan token output 1 juta untuk dampaknya pada implementasi klien.

Bisakah saya menggunakan Gemini 4 Argon hari ini?

Hanya melalui Program Fairwind Google untuk sekelompok mitra pertahanan siber terverifikasi. Pelanggan API berbayar dan pelanggan Google AI Ultra akan menyusul, tanpa tanggal yang ditentukan.

Pilih berdasarkan beban kerja, lalu uji

Argon terlihat paling kuat pada pekerjaan pengetahuan, konteks panjang, dan benchmark multimodal. Astra menonjol pada FrontierSWE, Terminal-Bench Science, dan OSWorld. Opus 5.5 unggul pada pekerjaan terminal dan rekayasa ML, dengan harga yang akan setara dengan Argon setelah periode perkenalan berakhir.

Untuk implementasi saat ini:

  1. Bangun routing di atas Astra dan Opus 5.5, karena keduanya tersedia.
  2. Simpan model Gemini dalam environment variable.
  3. Gunakan prompt, assertion, dan dataset evaluasi yang sama.
  4. Jalankan ulang skenario saat Argon tersedia.
  5. Pilih berdasarkan kualitas tugas, token aktual, latency, dan biaya—bukan hanya satu skor benchmark.

Untuk menyiapkan perbandingan tiga request dalam satu proyek, unduh Apidog.

Top comments (0)