Claude Opus 5 diluncurkan pada 24 Juli 2026 dengan harga $5 per juta token input dan $25 per juta token output. Ini adalah tarif yang sama dengan yang dikenakan Anthropic untuk Opus 4.8, dan tepat setengah dari biaya Fable 5. Namun, tarif dasar saja tidak cukup untuk memperkirakan tagihan: penulisan cache, hit cache, batch, mode cepat, pengganda regional, dan perubahan perilaku model dapat menggeser total token. Untuk memeriksa angka terhadap lalu lintas Anda sendiri, kirim permintaan dari Apidog dan baca blok usage pada setiap respons.
Tabel harga lengkap Claude Opus 5
Setiap tarif di bawah ini berasal dari dokumentasi harga Anthropic dan berlaku untuk ID model claude-opus-5.
| Kategori Token | Harga per Juta Token |
|---|---|
| Input (standar) | $5.00 |
| Output (standar) | $25.00 |
| Penulisan cache prompt, TTL 5 menit | $6.25 |
| Penulisan cache prompt, TTL 1 jam | $10.00 |
| Hit cache dan penyegaran | $0.50 |
| Input API Batch | $2.50 |
| Output API Batch | $12.50 |
| Input mode cepat | $10.00 |
| Output mode cepat | $50.00 |
Hal yang perlu diperhatikan:
- Hit cache berharga sepersepuluh dari input standar. Ini adalah pengungkit biaya terbesar.
- Penulisan cache 5 menit membawa premi 1.25x dibandingkan input standar; penulisan 1 jam membawa premi 2x.
- Batch mendapatkan diskon rata 50% untuk input dan output.
- Mode cepat tepat 2x harga standar untuk kecepatan output sekitar 2.5x. Ini adalah pratinjau riset, hanya tersedia melalui API pihak pertama—bukan Bedrock, Google Cloud, atau Microsoft Foundry—dan tidak dapat digabungkan dengan API Batch.
- Tidak ada premium konteks panjang. Jendela konteks 1 juta token adalah default sekaligus maksimum. Token yang melewati ambang konteks apa pun tetap ditagih $5 per juta token input.
Poin terakhir tersebut memberi batas atas yang jelas untuk satu permintaan. Panggilan Messages API termahal adalah 1 juta token input ditambah maksimum 128 ribu token output:
- Input: $5.00
- Output: $3.20
- Total: $8.20
Pada API Batch, output maksimum dapat naik menjadi 300 ribu token dengan header beta output-300k-2026-03-24. Dalam kasus itu, sisi output dibatasi pada $3.75.
Jangkar: sama dengan 4.8, setengah dari Fable 5
Berikut posisi Opus 5 dibandingkan model yang paling mungkin Anda evaluasi.
| Model | Input / Juta Token | Output / Juta Token |
|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Sonnet 5 (perkenalan, hingga 31 Agustus 2026) | $2.00 | $10.00 |
| Claude Sonnet 5 (mulai 1 September 2026) | $3.00 | $15.00 |
Dua implikasi utama:
Upgrade dari Opus 4.8 tidak mengubah biaya per token. Tarifnya identik dan tetap sama di seluruh versi 4.5, 4.6, 4.7, dan 4.8. Pergantian ID model tidak mengubah ekonomi unit Anda, tetapi volume token dapat berubah. Rincian harga Opus 4.8 masih relevan untuk ID model lama.
Opus 5 berharga setengah dari Fable 5. Anthropic mengklaim Opus 5 mencapai jarak 0.5% dari puncak Fable 5 di CursorBench 3.2 dan melampauinya di OSWorld 2.0 dengan sekitar sepertiga biaya per tugas. Angka tersebut berasal dari postingan peluncuran Opus 5 dan belum direproduksi secara independen pada 25 Juli 2026. Perlakukan sebagai klaim vendor, bukan hasil yang pasti. Lihat perbandingan Opus 5 vs Fable 5 dan halaman harga Fable 5 untuk detail lebih lanjut.
Contoh kerja 1: satu permintaan
Mulai dari bentuk paling sederhana: permintaan ringkasan dengan 8.000 token input dan 1.200 token output.
- Input:
8.000 / 1.000.000 × $5.00= $0.040 - Output:
1.200 / 1.000.000 × $25.00= $0.030 - Total: $0.070 per panggilan
Dengan 10.000 panggilan per bulan, totalnya adalah $700.
Perbandingan untuk beban kerja yang sama:
| Model | Biaya per panggilan | Biaya per bulan (10.000 panggilan) |
|---|---|---|
| Opus 5 | $0.070 | $700 |
| Fable 5 | $0.140 | $1,400 |
| Sonnet 5, tarif perkenalan | $0.028 | $280 |
Meskipun input hampir tujuh kali lebih besar daripada output, output menyumbang 43% tagihan. Ini karena output lima kali lebih mahal daripada input.
Hal ini lebih penting pada Opus 5 karena token “berpikir” ditagih sebagai output dan pemikiran adaptif aktif secara default.
Contoh kerja 2: sesi agenik panjang dengan caching
Pertimbangkan agen coding dengan:
- Prompt sistem dan konteks repo: 120.000 token
- Durasi sesi: 40 giliran
- Input baru per giliran: 1.500 token
- Output per giliran: 2.500 token
Tanpa prompt caching
Jika Anda mengirim ulang konteks penuh pada setiap giliran:
| Item baris | Token | Tarif | Biaya |
|---|---|---|---|
Input: (120.000 × 40) + 60.000
|
4.860.000 | $5.00 | $24.30 |
Output: 2.500 × 40
|
100.000 | $25.00 | $2.50 |
| Total | $26.80 |
Dengan cache prompt TTL 5 menit
| Item baris | Token | Tarif | Biaya |
|---|---|---|---|
| Penulisan cache, sekali | 120.000 | $6.25 | $0.75 |
| Pembacaan cache, 39 giliran | 4.680.000 | $0.50 | $2.34 |
Input baru: 1.500 × 40
|
60.000 | $5.00 | $0.30 |
Output: 2.500 × 40
|
100.000 | $25.00 | $2.50 |
| Total | $5.89 |
Hasilnya adalah pengurangan biaya 78%.
Setelah caching diterapkan dengan benar, output menjadi bagian biaya berikutnya yang perlu dioptimalkan. Dalam contoh ini, output berubah dari 9% menjadi 42% dari total tagihan.
Pilih TTL cache yang sesuai
Cache TTL 5 menit akan disegarkan oleh pembacaan cache. Jika jarak antargiliran kurang dari lima menit, Anda cukup membayar satu kali penulisan cache.
Jika agen menganggur lebih lama:
- Gunakan TTL 1 jam.
- Tarif penulisan cache naik menjadi $10 per juta token.
- Pada contoh ini, biaya penulisan naik dari $0.75 menjadi $1.20.
- Total sesi menjadi $6.34, masih 76% lebih rendah daripada tanpa cache.
Contoh kerja 3: pemrosesan batch
Untuk pekerjaan yang tidak membutuhkan respons sinkron, gunakan API Batch. Diskonnya rata 50%.
Contoh: 50.000 dokumen, masing-masing berisi 1.200 token input dan 150 token output.
| Jalur | Biaya input | Biaya output | Total |
|---|---|---|---|
| Standar | 60 juta token × $5.00 = $300.00 | 7.5 juta token × $25.00 = $187.50 | $487.50 |
| Batch | 60 juta token × $2.50 = $150.00 | 7.5 juta token × $12.50 = $93.75 | $243.75 |
Token dan modelnya sama, tetapi API Batch menghemat $243.75.
Gunakan batch untuk pekerjaan seperti:
- Klasifikasi dalam volume besar
- Pengayaan data
- Evaluasi model
- Ringkasan malam hari
- Pemrosesan konten yang tidak memerlukan respons langsung
Imbalannya adalah latensi, bukan kualitas.
Contoh kerja 4: berapa biaya mode cepat?
Mode cepat menggandakan tarif menjadi $10 untuk input dan $50 untuk output, dengan kecepatan output sekitar 2.5x.
Gunakan angka dari contoh pertama:
- Input:
8.000 / 1.000.000 × $10.00= $0.080 - Output:
1.200 / 1.000.000 × $50.00= $0.060 - Total: $0.140 per panggilan
Ini tepat dua kali lipat dari tarif standar.
Mode cepat cocok untuk antarmuka interaktif saat pengguna melihat token dihasilkan secara langsung. Untuk pekerjaan latar belakang, biasanya sulit dibenarkan karena API Batch dan mode cepat tidak dapat digabungkan.
Empat pengungkit yang benar-benar menggerakkan tagihan Anda
1. Minimum cache prompt turun menjadi 512 token
Pada Opus 4.8, minimum prompt yang dapat di-cache adalah 1.024 token. Pada Opus 5, minimum tersebut turun menjadi 512 token.
Artinya, prompt sistem pendek yang sebelumnya tidak memenuhi syarat kini dapat di-cache dengan menambahkan blok kontrol cache.
Titik impas caching:
- TTL 5 menit: menguntungkan mulai panggilan kedua.
- TTL 1 jam: menguntungkan mulai panggilan ketiga.
Contoh prompt sistem 700 token yang digunakan ulang dalam 1.000 panggilan:
| Strategi | Biaya |
|---|---|
| Tanpa cache | $3.50 |
| Dengan cache | $0.354 |
Rinciannya:
- Penulisan cache: $0.0044
- 999 pembacaan cache: $0.00035
- Total: $0.354
Prompt 700 token tersebut tidak dapat di-cache pada Opus 4.8.
2. Batch dengan diskon 50%
Audit semua workload dan tanyakan: apakah respons harus sinkron?
Jika tidak, pindahkan ke API Batch. Kandidat umum:
- Evaluasi regresi
- Klasifikasi konten
- Pengisian ulang data
- Ringkasan terjadwal
- Proses ETL berbasis LLM
3. Tingkat upaya low dan medium dapat digunakan
output_config.effort mengontrol seberapa banyak model berpikir. Token “berpikir” ditagih sebagai output dengan tarif $25 per juta token.
Opus 5 mengkalibrasi ulang tingkat upaya. Anthropic menyatakan low dan medium jauh lebih kuat daripada tingkat yang sama pada model Opus sebelumnya.
- Default:
high - Rekomendasi awal untuk coding dan workload agenik:
xhigh
Contoh ilustratif:
-
xhigh: 8.000 token berpikir -
low: 1.500 token berpikir - Penghematan: 6.500 token output per tugas
- Biaya yang dihemat per tugas: $0.1625
- Untuk 100.000 tugas: $16,250
Angka tersebut hanya ilustratif. Jalankan evaluasi Anda sendiri untuk menentukan tingkat upaya terendah yang masih lolos metrik kualitas.
Panduan parameter upaya membahas cara mengevaluasinya.
Menurunkan
effortmengurangi token berpikir, bukan panjang respons yang terlihat. Jika respons terlalu panjang, instruksikan model untuk menjawab lebih singkat.
4. Overhead prompt sistem untuk penggunaan alat lebih rendah
Saat Anda mengirim definisi tool, API menyuntikkan prompt sistem yang ikut ditagihkan.
Pada Opus 5, overhead tersebut adalah 286 token untuk pilihan alat auto atau none.
Perbandingan:
| Model | Overhead tool prompt |
|---|---|
| Opus 5 | 286 token |
| Opus 4.8 | 290 token |
| Opus 4.7 | 675 token |
Dibandingkan Opus 4.8, selisih empat token hanya sekitar $20 untuk satu juta permintaan, sehingga tidak material.
Dibandingkan Opus 4.7, penghematannya adalah:
- Selisih: 389 token per permintaan
- Penghematan: $0.001945 per permintaan
- Pada satu juta permintaan: $1,945
Untuk pengungkit lintas jajaran Claude, lihat panduan memangkas tagihan API Claude.
Dua item baris yang sering terlewatkan
Pengganda inference_geo: "us" adalah 1.1x
Jika Anda menyematkan inferensi ke infrastruktur khusus AS untuk kepatuhan atau residensi data, semua kategori token dikalikan 1.1:
| Kategori | Tarif setelah pengganda |
|---|---|
| Input | $5.50 |
| Output | $27.50 |
| Hit cache | $0.55 |
| Batch input | $2.75 |
| Batch output | $13.75 |
Pada contoh pertama, biaya bulanan berubah dari $700 menjadi $770.
Untuk tagihan $50.000, pengganda tersebut menambah $5.000. Gunakan penyematan regional hanya jika benar-benar diperlukan.
Priority Tier tidak didukung di Opus 5
Opus 4.8 masih mendukung Priority Tier. Jika perencanaan kapasitas Anda bergantung pada komitmen Priority Tier, ini merupakan batasan nyata saat migrasi.
Lihat panduan migrasi Opus 4.8 ke Opus 5 untuk perubahan API yang perlu diperhatikan.
Perubahan perilaku yang muncul di faktur Anda
Tarif per token hanya setengah dari biaya. Setengah lainnya adalah volume token.
Tiga perubahan perilaku Opus 5 dapat meningkatkan volume token jika Anda tidak menyesuaikan implementasi:
Thinking aktif secara default.
Pada Opus 4.8, permintaan tanpa bidangthinkingberjalan tanpa berpikir. Pada Opus 5, permintaan yang sama menjalankan pemikiran adaptif dan token tersebut ditagih sebagai output. Karenamax_tokensmembatasi token berpikir dan respons secara bersamaan, beberapa workload juga dapat mulai terpotong.Opus 5 lebih mudah mendelegasikan ke subagen.
Setiap subagen memiliki token yang ditagihkan sendiri. Batasi atau cakup delegasi pada workload sensitif biaya.Opus 5 memverifikasi pekerjaannya sendiri.
Jika prompt Anda masih berisi instruksi seperti “periksa kembali pekerjaan Anda”, hapus instruksi itu. Panduan prompt Anthropic menyarankan penghapusan instruksi tersebut karena verifikasi berlebihan adalah token tambahan.
Tidak satu pun mengubah harga per token. Semuanya dapat mengubah total yang Anda bayar.
Memastikan pengeluaran riil dengan Apidog
Cara tercepat untuk berhenti menebak adalah memeriksa objek usage pada setiap respons.
Bidang yang perlu Anda pantau:
{
"usage": {
"input_tokens": 0,
"output_tokens": 0,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
}
Nilai tersebut memberi rincian yang diperlukan untuk memverifikasi biaya input, output, penulisan cache, dan hit cache.
Apidog adalah platform pengembangan dan pengujian API. Arahkan request ke endpoint Messages dengan model claude-opus-5, lalu lakukan langkah berikut:
- Duplikasikan request yang disimpan untuk setiap tingkat
effort, lalu bandingkan volume token berpikir pada prompt identik. - Tegaskan bahwa
usage.cache_read_input_tokenslebih besar dari nol. Jadikan ini assertion agar cache yang rusak muncul sebagai tes gagal, bukan sebagai tagihan kejutan. - Simpan API key sebagai environment variable, bukan di body request.
- Pantau aliran SSE untuk melihat token output pada generasi panjang.
Contoh assertion sederhana untuk memastikan cache benar-benar digunakan:
pm.test("Prompt cache digunakan", function () {
const response = pm.response.json();
pm.expect(response.usage.cache_read_input_tokens).to.be.above(0);
});
Unduh Apidog untuk menjalankan pemeriksaan ini bersama panduan langkah demi langkah di panduan API Opus 5.
Apa yang sebenarnya Anda beli dengan harga $5 / $25?
Opus 5 menawarkan posisi harga-per-kemampuan yang kuat, tetapi bukan model teratas dalam jajaran Claude.
- Fable 5 tetap menjadi model Anthropic paling mumpuni yang dirilis secara luas.
- Opus 5 masih tertinggal dari Mythos 5 dalam eksploitasi keamanan siber dan riset biologi otonom.
Pembingkaian yang lebih akurat: kemampuan kelas terdepan dengan setengah harga terdepan, tetapi dengan batas atas yang jelas.
Lihat penjelasan kelas Mythos untuk konteks kemampuan di atas Opus 5.
Bagi banyak tim, pertanyaan pentingnya bukan Opus 5 versus model paling mahal. Pertanyaannya adalah apakah workload tersebut benar-benar membutuhkan Opus, atau apakah Sonnet 5 dengan harga $2 / $10—naik menjadi $3 / $15 pada 1 September 2026—sudah cukup.
Jalankan keduanya terhadap evaluasi Anda sendiri sebelum mengalokasikan anggaran. Lihat spesifikasi dan ketersediaan di ikhtisar Claude Opus 5 atau ikhtisar model Anthropic.
FAQ
Berapa biaya Claude Opus 5?
$5 per juta token input dan $25 per juta token output pada API standar. Hit cache berharga $0.50, batch berjalan pada $2.50 / $12.50, dan mode cepat pada $10 / $50.
Apakah Claude Opus 5 lebih mahal dari Opus 4.8?
Per token, tidak. Tarifnya identik. Namun, tagihan dapat naik karena thinking aktif secara default dan respons default lebih panjang. Ukur volume token, jangan mengasumsikan paritas biaya.
Apakah ada biaya tambahan konteks panjang pada jendela 1 juta token?
Tidak. Jendela konteks 1 juta token adalah default dan maksimum, tanpa tingkat premium untuk input panjang.
Apa cara termurah untuk menjalankan Claude Opus 5?
Gunakan prompt caching secara agresif, jalankan pekerjaan tidak mendesak melalui API Batch untuk diskon 50%, dan uji tingkat effort terendah yang masih lolos evaluasi. Lihat panduan jalur gratis dan termurah untuk detail tambahan.
Apakah penyematan regional dikenakan biaya tambahan?
Ya. Mengatur inference_geo: "us" menerapkan pengganda 1.1x ke setiap kategori token, termasuk hit cache dan batch.


Top comments (0)