DEV Community

Cover image for OpenAI Memangkas Harga API GPT-5.6: Luna Turun 80%, Terra Turun 20% (Rincian Harga Baru)
Walse
Walse

Posted on • Originally published at apidog.com

OpenAI Memangkas Harga API GPT-5.6: Luna Turun 80%, Terra Turun 20% (Rincian Harga Baru)

OpenAI memangkas harga API untuk dua dari tiga model GPT-5.6 pada 30 Juli 2026. GPT-5.6 Luna kini 80% lebih murah, menjadi $0,20 per juta token input dan $1,20 per juta token output. GPT-5.6 Terra turun 20% menjadi $2 untuk input dan $12 untuk output. GPT-5.6 Sol, model penalaran unggulan, tetap di $5 dan $30, tetapi kini memiliki mode Cepat yang berjalan 2,5x lebih cepat dengan harga dua kali tarif standar.

Coba Apidog hari ini

Jika model biaya Anda masih memakai harga peluncuran GPT-5.6, perbarui perhitungannya sekarang. Perubahan ini memengaruhi keputusan perutean model, terutama untuk workload batch, ekstraksi, ringkasan, dan agent loop. Untuk membandingkan biaya secara praktis, kirim prompt yang sama ke Sol, Terra, dan Luna, lalu bandingkan token aktual serta kualitas hasilnya. Apidog membantu menjalankan pengujian tersebut dari satu koleksi API.

Daftar harga GPT-5.6 yang baru

Berikut perbandingan harga sebelum dan sesudah per satu juta token:

Model Input lama Input baru Output lama Output baru Perubahan
GPT-5.6 Sol $5,00 $5,00 $30,00 $30,00 Tidak ada perubahan
GPT-5.6 Terra $2,50 $2,00 $15,00 $12,00 -20%
GPT-5.6 Luna $1,00 $0,20 $6,00 $1,20 -80%

Harga baru berlaku mulai 30 Juli 2026 untuk tingkatan API standar. Selisih biaya antara Sol dan Luna kini jauh lebih besar: dari sekitar 5x saat ketersediaan umum pada 9 Juli menjadi 25x. Dalam praktiknya, memilih Luna alih-alih Sol kini dapat menghemat sekitar 96% biaya tarif list untuk volume token yang sama.

Diskon caching prompt tetap berlaku di atas tarif ini. Namun, OpenAI belum menerbitkan harga input cache terpisah untuk tarif Luna dan Terra yang baru dalam pengumumannya. Sebelum memperbarui proyeksi tagihan yang bergantung pada cache hit, periksa halaman harga resmi.

Apa yang berubah pada Sol

Tarif standar GPT-5.6 Sol tidak berubah, tetapi opsi performanya berubah. OpenAI memperkenalkan mode Cepat untuk Sol:

  • Kecepatan generasi token: 2,5x lebih cepat
  • Tarif: 2x harga standar
  • Pengganti: tingkatan Pemrosesan Prioritas sebelumnya

Jika produksi Anda masih menggunakan Pemrosesan Prioritas, audit konfigurasi dan faktur Anda. Migrasikan workload tersebut ke mode Cepat, lalu verifikasi bahwa biaya aktualnya sesuai dengan ekspektasi.

Secara operasional, Sol kini disegmentasikan berdasarkan kebutuhan latensi, bukan diskon harga:

  • Gunakan Sol standar untuk penalaran premium tanpa kebutuhan respons paling cepat.
  • Gunakan Sol Cepat jika latensi interaktif lebih penting daripada biaya.
  • Evaluasi Terra atau Luna untuk pekerjaan yang dapat diturunkan tanpa mengorbankan kualitas yang dibutuhkan.

Mengapa OpenAI memangkas harga

OpenAI menjelaskan pemotongan harga ini sebagai hasil efisiensi inferensi yang diteruskan ke pelanggan. Pengumuman tersebut menyebut empat pendorong:

  • Perutean perangkat keras yang lebih baik di seluruh armada inferensi
  • Perangkat lunak inferensi produksi yang lebih efisien
  • Algoritma caching konteks yang lebih cerdas
  • Kernel kode produksi yang ditulis ulang oleh GPT-5.6 Sol

OpenAI menyatakan bahwa Sol secara otonom menulis ulang kernel penyajian, mengurangi overhead penyajian end-to-end sebesar 20% dan meningkatkan efisiensi generasi token lebih dari 15%. Dampaknya bagi developer sederhana: biaya serving cukup turun sehingga Luna dapat dipangkas 80%.

Persaingan juga menjadi faktor penting. Liputan VentureBeat membingkai perubahan ini sebagai respons terhadap tingkatan Flash dari Google. Tarif gabungan Luna—input ditambah output—sekarang $1,40 per satu juta token, lebih rendah daripada Gemini 3.5 Flash-Lite seharga $2,80 dan Gemini 3.6 Flash seharga $9.

Dampak untuk workload Anda

Pemotongan harga Luna sebesar 80% adalah perubahan yang paling mungkin memengaruhi arsitektur Anda. Berikut area yang perlu dievaluasi ulang.

1. Agent loop menjadi lebih murah

Workload agent biasanya mengonsumsi token melalui beberapa tahap:

  1. Merencanakan langkah
  2. Memanggil tool
  3. Membaca hasil tool
  4. Memperbaiki rencana
  5. Mengulangi proses

Pada tarif lama, agent loop di Luna membutuhkan pertimbangan biaya yang lebih ketat. Dengan harga baru $0,20 input dan $1,20 output, Luna lebih layak dijadikan default untuk loop agen yang tidak memerlukan kemampuan Sol.

2. Turunkan klasifikasi, ekstraksi, dan ringkasan ke Luna

Jika Anda sebelumnya memilih Terra untuk klasifikasi, ekstraksi data, atau ringkasan karena perbedaan kualitas terasa tipis, jalankan evaluasi ulang. Kualitas model tidak berubah, tetapi struktur biaya berubah drastis.

Sebagai gambaran, workload yang menghabiskan $100 per hari di Terra dapat turun menjadi sekitar $11 per hari di Luna pada tarif baru, tergantung rasio token input dan output.

3. Terra tetap menjadi default yang kuat

Analisis Sol vs Terra vs Luna kami merekomendasikan Terra sebagai default yang masuk akal untuk pekerjaan sehari-hari. Rekomendasi itu tetap relevan, dan sekarang biayanya 20% lebih rendah.

Gunakan Terra ketika Luna belum mencapai kualitas yang Anda butuhkan, tetapi Sol terasa terlalu mahal untuk workload tersebut.

4. Tetap kontrol tingkat upaya penalaran

GPT-5.6 menyediakan enam tingkat upaya penalaran. Tingkat upaya yang lebih tinggi dapat menghasilkan lebih banyak token output, sementara output adalah komponen biaya terbesar di semua tingkatan model.

Jangan hanya mengganti model. Audit juga konfigurasi upaya penalaran Anda:

Jika kualitas cukup pada upaya rendah:
  turunkan effort terlebih dahulu

Jika kualitas masih belum cukup:
  naikkan effort secara bertahap

Jika hasil tetap tidak memenuhi evaluasi:
  naikkan tier model
Enter fullscreen mode Exit fullscreen mode

Urutan ini biasanya lebih hemat dibanding langsung menaikkan semua permintaan ke Sol.

Cara memeriksa ulang biaya dengan trafik Anda sendiri

Jangan hanya mengandalkan persentase harga. Ukur prompt dan respons aktual dari aplikasi Anda.

Gunakan alur kerja berikut:

  1. Ambil sampel representatif dari prompt produksi.
  2. Kirim setiap prompt ke gpt-5.6-luna, gpt-5.6-terra, dan gpt-5.6-sol.
  3. Simpan token input, token output, latensi, dan hasil evaluasi kualitas.
  4. Hitung biaya berdasarkan tarif baru.
  5. Tetapkan aturan perutean berdasarkan kualitas minimum dan biaya maksimum.

Gunakan rumus berikut untuk menghitung biaya per permintaan:

biaya =
  (input_tokens / 1_000_000 × tarif_input) +
  (output_tokens / 1_000_000 × tarif_output)
Enter fullscreen mode Exit fullscreen mode

Contoh struktur data evaluasi:

{
  "model": "gpt-5.6-luna",
  "input_tokens": 1200,
  "output_tokens": 450,
  "quality_score": 0.91,
  "latency_ms": 1800
}
Enter fullscreen mode Exit fullscreen mode

Apidog mempercepat langkah pengujian ini. Definisikan endpoint chat completion sekali, gunakan variabel lingkungan untuk ID model, lalu jalankan skenario yang sama terhadap ketiga tingkatan.

Misalnya, simpan ID model sebagai variabel:

MODEL_ID=gpt-5.6-luna
Enter fullscreen mode Exit fullscreen mode

Kemudian jalankan koleksi yang sama dengan nilai berikut:

gpt-5.6-luna
gpt-5.6-terra
gpt-5.6-sol
Enter fullscreen mode Exit fullscreen mode

Periksa blok usage pada setiap respons untuk mendapatkan jumlah token input dan output aktual. Jika Anda baru mengintegrasikan GPT-5.6, panduan menggunakan API GPT-5.6 membahas autentikasi, ID model, dan format permintaan. Anda juga dapat memalsukan endpoint saat menunggu persetujuan anggaran, lalu beralih ke trafik langsung tanpa menulis ulang pengujian.

Unduh Apidog secara gratis untuk menjalankan perbandingan ini.

Gambaran yang lebih besar: perang harga masih berlangsung

Ini adalah pergerakan harga besar ketiga di sisi murah frontier model pada musim panas ini. Google menyegarkan tingkatan Flash pada Juli, Anthropic meluncurkan Claude Opus 5 dengan setengah harga Fable 5, dan OpenAI kini memangkas Luna di bawah kedua opsi Gemini Flash.

Bagi tim API, pilihan model tidak boleh lagi dianggap sebagai keputusan tahunan. Perlakukan perutean model sebagai bagian dari infrastruktur:

  • Simpan ID model sebagai konfigurasi, bukan hardcode.
  • Pertahankan suite evaluasi yang stabil.
  • Catat token, latensi, error rate, dan skor kualitas.
  • Jalankan ulang benchmark saat vendor mengubah harga atau model.
  • Terapkan fallback model berdasarkan jenis workload.

Tim yang memiliki pengujian dan pemantauan perutean akan menangkap penghematan harga dalam hitungan hari, bukan kuartal.

FAQ

Berapa harga API GPT-5.6 yang baru?

Per 30 Juli 2026:

Model Input per 1 juta token Output per 1 juta token
GPT-5.6 Luna $0,20 $1,20
GPT-5.6 Terra $2,00 $12,00
GPT-5.6 Sol $5,00 $30,00

Sol juga memiliki mode Cepat dengan harga dua kali lipat dari standar untuk pemrosesan 2,5x lebih cepat.

Apakah GPT-5.6 Sol mendapatkan pemotongan harga?

Tidak. Tarif standar Sol tetap sama. Perubahan Sol bersifat struktural: mode Cepat menggantikan Pemrosesan Prioritas dan menawarkan kecepatan 2,5x dengan harga dua kali lipat.

Apakah GPT-5.6 Luna sekarang lebih murah daripada Gemini Flash?

Berdasarkan harga list gabungan input dan output, ya. Luna berharga $1,40 per satu juta token, dibandingkan $2,80 untuk Gemini 3.5 Flash-Lite dan $9 untuk Gemini 3.6 Flash.

Namun, harga bukan pengganti evaluasi kualitas. Jalankan ketiga model terhadap set evaluasi Anda sebelum memindahkan workload produksi. Jika ingin mencoba rute gratis terlebih dahulu, lihat cara menggunakan GPT-5.6 secara gratis.

Apakah pemotongan harga berlaku secara otomatis?

Ya. Tarif baru berlaku otomatis untuk penggunaan API standar mulai 30 Juli 2026 tanpa perubahan kode. Tindakan hanya diperlukan jika Anda menggunakan Pemrosesan Prioritas pada Sol, karena tingkatan tersebut digantikan oleh mode Cepat.

Apa yang harus dilakukan minggu ini

Jalankan checklist berikut:

  1. Perbarui model biaya dengan tarif Luna dan Terra yang baru.
  2. Identifikasi workload yang dapat dipindahkan dari Sol atau Terra ke Luna.
  3. Uji Luna, Terra, dan Sol menggunakan prompt produksi yang representatif.
  4. Bandingkan biaya token, latensi, dan kualitas hasil.
  5. Audit penggunaan Pemrosesan Prioritas Sol dan rencanakan migrasi ke mode Cepat.
  6. Jadikan ID model sebagai konfigurasi agar perubahan perutean tidak memerlukan deploy kode.

Mulailah dari satu skenario pengujian di Apidog, jalankan tiga ID model, lalu gunakan data usage aktual untuk menentukan nilai penghematan bagi aplikasi Anda.

Top comments (0)