DEV Community

Cover image for Perbandingan Gemini 4 Argon vs Gemini 3.8 Flash: Haruskah Menunggu Argon atau Menggunakan Flash Sekarang?
Walse
Walse

Posted on Originally published at apidog.com

Perbandingan Gemini 4 Argon vs Gemini 3.8 Flash: Haruskah Menunggu Argon atau Menggunakan Flash Sekarang?

Gemini 3.8 Flash tersedia hari ini sebagai model stabil dengan tingkat gratis. Harganya $0,75 untuk input dan $3,75 untuk output per 1 juta token hingga 31-12-2026, lalu $1,50 dan $7,50, dengan batas output 64K. Gemini 4 Argon belum tersedia secara umum. Posting peluncuran Google mencantumkan harga perkenalan $2 untuk input dan $10 untuk output, lalu $4 dan $20 setelah periode perkenalan yang tanggal akhirnya belum diumumkan. Google menyatakan batas output Argon mencapai 1 juta token, tetapi saat ini hanya tersedia untuk pembela Program Fairwind. Jika Anda perlu rilis kuartal ini, gunakan Flash dan siapkan Argon agar nanti cukup diaktifkan lewat satu perubahan konfigurasi.

Coba Apidog hari ini

Artikel ini membandingkan spesifikasi, benchmark yang dibagikan dalam kedua posting peluncuran, skor siber, dan biaya untuk panggilan identik. Di akhir, Anda akan menyiapkan request yang dapat beralih model lewat satu variabel. Untuk konteks, baca apa itu Gemini 4 Argon dan apa itu Gemini 3.8 Flash.

Perbandingan: model yang dapat Anda panggil hari ini

Gemini 3.8 Flash Gemini 4 Argon
Ketersediaan Stabil di Gemini API, AI Studio, Antigravity, dan Gemini Enterprise Subset mitra Program Fairwind sebagai model terkelola di Gemini Enterprise
ID model gemini-3.8-flash Belum dipublikasikan
Harga per 1 juta token (input / output) $0,75 / $3,75 hingga 31-12-2026, lalu $1,50 / $7,50 $2 / $10 saat perkenalan, lalu $4 / $20
Input cache per 1 juta token $0,075, lalu $0,15 $0,10 saat perkenalan, lalu $0,20
Batas output 65.536 token 1 juta token menurut Google
Jendela input 1.048.576 token Belum dipublikasikan
Tingkat pemikiran low, medium (default), high; minimal menghasilkan HTTP 400 Belum didokumentasikan
Tingkat API gratis Ya, dengan batas laju Belum diumumkan
Akses konsumen Aplikasi Gemini di AI Pro dan Ultra, serta Mode AI di Search Belum tersedia; pelanggan AI Ultra disebut sebagai gelombang pertama tanpa tanggal

Beberapa detail perlu diperlakukan dengan hati-hati:

  • Google belum mempublikasikan jendela input Argon, walaupun evaluasi konteks panjangnya menggunakan prompt hingga 1 juta token.
  • Google menyatakan batas output Argon adalah 1 juta token. Namun, evaluator pihak ketiga Vals AI mencantumkan output maksimum 262K untuk konfigurasi yang diuji.
  • Evaluasi Argon berjalan dengan “pengaturan pemikiran tertinggi”. Kemungkinan ada tingkat tinggi, tetapi Google belum mendokumentasikan nama tingkat atau nilai defaultnya.
  • Tingkat Flash tersedia di dokumentasi pemikiran Google dan panduan tingkat pemikiran Gemini 3.8 Flash.

Tingkat gratis Flash memiliki batas laju, dan Google menyatakan data dari tingkat gratis “digunakan untuk meningkatkan produk kami”. Google belum mengumumkan akses gratis untuk Argon. Lihat penjelasan akses gratis Argon untuk alternatif yang dapat digunakan sekarang.

Benchmark yang dibagikan dalam kedua posting peluncuran

Kedua tabel peluncuran Google membagikan dua benchmark berikut. Angka ini dilaporkan oleh Google, sementara metodologi Argon mengaitkan kedua benchmark tersebut dengan Vals AI.

Benchmark Gemini 3.8 Flash Gemini 4 Argon
Vals Finance Agent v2 61,4% 65,4%
Harvey Legal Agent Benchmark 10,0% 19,6%

Google mempublikasikan tabel tersebut terpaut satu bulan dan membandingkannya dengan kelompok pesaing yang berbeda. Jadi, perlakukan selisihnya sebagai indikator arah, bukan uji terkontrol.

Namun, dua hal terlihat jelas:

  • Pada benchmark hukum, Argon mencapai 19,6%, hampir dua kali skor Flash sebesar 10,0%.
  • Pada benchmark keuangan, Argon unggul 4 poin: 65,4% dibanding 61,4%.

Benchmark lain pada tabel Argon tidak memiliki padanan Gemini 3.8 Flash di teks peluncuran. Tabel Flash memuat HLE-Verified, yang tidak muncul di Argon, sedangkan skor DeepSWE Flash hanya tersedia dalam gambar kartu model.

Di Text Arena, papan peringkat pihak ketiga, Argon dengan pengaturan tinggi berada di posisi #1 pada voting awal. Gemini 3.8 Flash dengan pengaturan tinggi berada di posisi #11. Lihat rincian benchmark Argon untuk tabel lengkap 19 baris dan sumber pengukurannya.

Siber: Argon vs Gemini 3.8 Flash Cyber

Halaman siber DeepMind membandingkan Argon dengan Gemini 3.8 Flash Cyber, varian Flash yang dibatasi Fairwind.

Evaluasi siber Gemini 4 Argon Gemini 3.8 Flash Cyber
Penemuan kerentanan dunia nyata 85,8% 71,0%
Wiz Penetration Test Benchmark 70,9% 58,2%

Kedua model tersebut memiliki batas akses:

  • Gemini 3.8 Flash Cyber tersedia secara umum di belakang daftar izin pada Gemini Enterprise Agent Platform.
  • Argon hanya tersedia untuk Fairwind.

Jika Anda bukan mitra Fairwind, angka benchmark tidak mengubah model yang dapat dipanggil sekarang: Gemini 3.8 Flash umum adalah pilihan yang bisa langsung digunakan untuk membangun aplikasi.

Hitung biaya untuk panggilan yang sama

Gunakan contoh panggilan berikut:

  • Input: 100.000 token
  • Output: 8.000 token
  • Token pemikiran sudah termasuk dalam output 8.000 token untuk Gemini 3.8 Flash

Google belum menjelaskan cara Argon menagih token pemikiran. Perhitungan Argon berikut mengasumsikan model tersebut mengikuti pola penagihan Gemini saat ini.

Model dan periode Biaya input Biaya output Total per panggilan
Gemini 3.8 Flash, perkenalan 0,1 juta × $0,75 = $0,075 0,008 juta × $3,75 = $0,030 $0,105
Gemini 3.8 Flash, mulai 01-01-2027 0,1 juta × $1,50 = $0,150 0,008 juta × $7,50 = $0,060 $0,210
Gemini 4 Argon, perkenalan 0,1 juta × $2 = $0,200 0,008 juta × $10 = $0,080 $0,280
Gemini 4 Argon, standar 0,1 juta × $4 = $0,400 0,008 juta × $20 = $0,160 $0,560

Tarif per token Argon adalah 8/3, atau sekitar 2,67 kali tarif Flash, baik pada harga perkenalan maupun harga standar.

Jika menjalankan 1.000 panggilan seperti contoh tersebut per hari:

  • Flash pada tarif perkenalan: $105/hari
  • Argon pada tarif perkenalan: $280/hari

Perhatikan tiga faktor yang dapat mengubah rasio ini.

  1. Jumlah token antarmodel tidak akan selalu sama.

    Prompt identik dapat menghasilkan output dan token pemikiran yang berbeda. Evaluasi Argon menggunakan pengaturan pemikiran tertinggi. Pada Flash, Google juga memperingatkan bahwa tingkat upaya lebih tinggi dapat menggunakan lebih banyak token.

  2. Output panjang mengubah arsitektur request.

    Respons 200.000 token tidak muat dalam batas Flash 65.536 token, sehingga harus dipecah menjadi beberapa panggilan. Di bawah batas output Argon yang dinyatakan Google, respons tersebut dapat dikirim dalam satu request.

Untuk output 200.000 token pada tarif perkenalan Argon:

   0,2 juta × $10 = $2,00
Enter fullscreen mode Exit fullscreen mode

Pada harga standar:

   0,2 juta × $20 = $4,00
Enter fullscreen mode Exit fullscreen mode

Output penuh 1 juta token berbiaya $10 pada tarif perkenalan atau $20 pada harga standar.

  1. Tanggal akhir harga perkenalan Argon belum diketahui. Harga perkenalan Flash berakhir pada 31-12-2026. Google belum mengumumkan kapan harga perkenalan Argon berakhir.

Flash juga memiliki Batch dengan diskon 50%: $0,375 untuk input dan $1,875 untuk output hingga 31 Desember, menurut halaman harga Gemini API. Google belum mempublikasikan harga Batch untuk Argon.

Untuk perhitungan lebih rinci, lihat panduan harga Argon dan panduan harga Gemini 3.8 Flash.

Kapan harus memakai Flash, dan kapan merencanakan Argon?

Luncurkan dengan Gemini 3.8 Flash sekarang jika

  • Anda dibatasi biaya. Flash berbiaya 3/8 dari Argon per token, dan Batch dapat mengurangi biaya itu hingga setengahnya.
  • Anda menangani volume tinggi. Klasifikasi, ekstraksi, routing, dan chat dalam skala besar cepat menjadi mahal pada tarif $10 per 1 juta token output.
  • Anda harus mulai hari ini. Flash memiliki ID model stabil, tingkat gratis untuk prototyping, dan jadwal harga yang dipublikasikan.
  • Output Anda muat dalam 65.536 token. Sebagian besar workload API berada dalam batas ini.

Rencanakan Argon jika

  • Pekerjaan Anda memiliki horizon panjang. Google menyatakan Argon dibangun untuk mempertahankan penalaran mendalam di seluruh workflow kompleks dan berhorizon panjang.
  • Anda membutuhkan output lebih dari 64K token. Contohnya penulisan ulang modul penuh, laporan panjang, atau migrasi besar.
  • Anda menjalankan agen hukum atau keuangan. Ini adalah dua benchmark yang memuat kedua model, dan Argon memimpin pada keduanya.
  • Anda adalah pembela Fairwind yang memenuhi syarat. Argon saat ini merupakan model unggulan program tersebut.

Anda tidak perlu memilih satu model untuk semua traffic. Gunakan Flash sebagai default, lalu arahkan request yang benar-benar sulit ke Argon saat aksesnya tersedia.

Implementasi: satu request tersimpan, dua model

Simpan nama model dalam variabel lingkungan. Jalankan request produksi pada Gemini 3.8 Flash sekarang, lalu ubah variabel ketika ID model Argon dipublikasikan.

Jangan menebak ID model Argon sebelum Google menerbitkannya.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Summarize this contract clause in 3 bullets."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "medium"
      },
      "maxOutputTokens": 8192
    }
  }'
Enter fullscreen mode Exit fullscreen mode

Gunakan konfigurasi lingkungan berikut:

export GEMINI_API_KEY="your-api-key"
export GEMINI_MODEL="gemini-3.8-flash"
Enter fullscreen mode Exit fullscreen mode

Saat Argon tersedia, perubahan utamanya seharusnya hanya:

export GEMINI_MODEL="ID_MODEL_ARGON_YANG_DITERBITKAN_GOOGLE"
Enter fullscreen mode Exit fullscreen mode

Setiap respons generateContent berakhir dengan usageMetadata. Di Apidog, simpan GEMINI_API_KEY dan GEMINI_MODEL sebagai environment variables, lalu simpan request ini sebagai baseline.

Tambahkan assertion berikut ke skenario pengujian Anda:

  • Status respons adalah 200
  • Field respons yang dibaca aplikasi tersedia
  • usageMetadata.thoughtsTokenCount tidak melewati batas biaya Anda
  • maxOutputTokens tetap dibatasi agar respons panjang tidak menghabiskan anggaran

Praktik yang disarankan:

  1. Jalankan request pada Flash.
  2. Simpan output dan usageMetadata.
  3. Simpan laporan pengujian sebagai baseline.
  4. Saat Argon tersedia, ganti satu variabel.
  5. Jalankan skenario yang sama.
  6. Bandingkan output, latency, dan penggunaan token secara berdampingan.

Siapkan juga versi Interactions API

Ada dua peringatan untuk hari peluncuran Argon:

  1. Google menyatakan bahwa “semua model baru” akan diluncurkan di Interactions API.
  2. Google belum menyatakan apakah Argon mendukung generateContent.

Karena itu, simpan juga request Interactions API di samping request generateContent:

POST https://generativelanguage.googleapis.com/v1beta/interactions
Enter fullscreen mode Exit fullscreen mode

Untuk Interactions API, konfigurasi tingkat pemikiran menggunakan:

generation_config.thinking_level
Enter fullscreen mode Exit fullscreen mode

Nama tingkat pemikiran Argon belum didokumentasikan. Karena itu, nilai medium yang digunakan oleh Flash mungkin tidak berlaku untuk Argon. Setelah Argon tersedia, uji konfigurasi yang didokumentasikan Google dan bandingkan penggunaan tokennya dengan baseline Flash.

FAQ

Apakah Gemini 4 Argon lebih baik daripada Gemini 3.8 Flash?

Pada dua benchmark yang dibagikan dalam kedua tabel peluncuran, ya. Argon mendapat 65,4% dibanding 61,4% pada Vals Finance Agent v2, serta 19,6% dibanding 10,0% pada Harvey Legal Agent Benchmark. Namun, Argon sekitar 2,67 kali lebih mahal per token dan belum dapat dipanggil secara umum.

Haruskah saya menunggu Gemini 4 Argon?

Tidak jika Anda perlu rilis sekarang. Google belum memberikan tanggal rilis, hanya menyebut “sesegera mungkin”, dimulai dari pelanggan API berbayar dan pelanggan AI Ultra.

Gemini 3.8 Flash atau Argon untuk proyek baru?

Mulai dengan Gemini 3.8 Flash dan simpan model dalam environment variable. Setelah Argon tersedia, pindahkan request yang membutuhkan output panjang atau kemampuan hukum dan keuangan yang lebih dalam setelah diuji menggunakan prompt nyata Anda.

Apakah ada cara gratis untuk menggunakan Argon?

Tidak. Google belum mengumumkan tingkat gratis. Lihat penjelasan akses gratis Argon untuk model Gemini gratis yang dapat digunakan hari ini.

Apakah Argon menggantikan Gemini 3.8 Flash?

Google belum menyatakannya. Google menyebut Argon sebagai model perbatasan baru, dan Reuters melaporkan ukurannya lebih besar daripada lini Pro sebelumnya. Artinya, Argon berada pada tingkat berbeda dari Flash, bukan sekadar pengganti langsung.

Langkah selanjutnya

Siapkan request hari ini, jalankan pada Gemini 3.8 Flash, dan simpan laporannya. Ketika Argon diluncurkan, Anda dapat mengetahui dalam beberapa menit apakah peningkatan kualitasnya sepadan dengan biaya untuk traffic Anda.

Unduh Apidog untuk membuat, menguji, dan membandingkan request kedua model.

Top comments (0)