GPT-6.1 Sol dan Claude Sonnet 5.5 sama-sama berharga $2 per juta token input dan $10 per juta token output. Keduanya juga dirilis selisih satu hari: Sonnet 5.5 pada 28 September 2026, lalu GPT-6.1 Sol pada 29 September. Karena vendor tidak membandingkan versi yang sama secara langsung, cara paling praktis untuk memilih adalah menguji keduanya pada tugas nyata Anda dan menghitung biaya per tugas berhasil, bukan hanya membandingkan harga per token.
Artikel ini merangkum spesifikasi, harga, klaim vendor, angka pihak ketiga—yang masih menggunakan GPT-6 Sol, bukan 6.1—serta langkah menjalankan evaluasi sendiri di Apidog. Untuk detail tiap model, lihat apa itu GPT-6.1 Sol dan apa itu Claude Sonnet 5.5.
GPT-6.1 Sol vs Claude Sonnet 5.5: spesifikasi dan harga
Sumber: halaman harga OpenAI, gambaran umum Sonnet 5.5 dan harga Anthropic, serta halaman model GPT-6.1 Sol.
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| ID model | gpt-6.1-sol |
claude-sonnet-5-5(Bedrock: anthropic.claude-sonnet-5-5) |
| Dirilis | 29 Sep 2026 | 28 Sep 2026 |
| Input / output per 1 juta | $2 / $10 | $2 / $10 |
| Pembacaan cache per 1 juta | $0.10 | $0.20 |
| Penulisan cache per 1 juta | $2.50 | $2.50 (5 menit), $4 (1 jam) |
| Batch per 1 juta | $1 / $5 | $1 / $5 |
| Prompt di atas 272K token input | $4 input, $0.20 di-cache, $15 output untuk seluruh permintaan | Tidak ada premium di seluruh jendela 1 juta |
| Tingkat lebih cepat | Cepat seharga $4 / $20; Ultrafast “segera hadir” | Mode cepat tidak tersedia |
| Jendela konteks | 1.050.000 (maks. input 922.000) | 1 juta |
| Output maks. | 128.000 | 128K (300K pada Batch dengan header beta) |
| Batas pengetahuan | 30 Apr 2026 | Juni 2026 |
| Tingkat usaha |
low, medium (default), high, xhigh, max; tidak ada none
|
low, medium, high (default API), xhigh, max; berpikir tidak dapat dimatikan |
| Bentuk API | Responses (dengan alat), Chat Completions (tanpa alat), Batch | Messages, Batch |
| Platform lain | OpenRouter (openai/gpt-6.1-sol) |
Bedrock, Google Cloud, Microsoft Foundry, Claude Platform di AWS |
| Akses gratis | Tidak ada. Plus, Pro, Business, Enterprise, dan Edu mendapatkannya di ChatGPT Work dan Codex, bukan Chat; tidak ada tingkat API gratis | Dapat digunakan di Claude.ai; API menagih per token |
Dua detail biaya yang paling penting:
- Cache read GPT-6.1 Sol lebih murah. Jika Anda memakai system prompt panjang yang sama berulang kali, GPT-6.1 Sol dapat lebih murah karena cache read-nya $0.10 per juta token, dibanding $0.20 pada Sonnet 5.5.
- Prompt besar di atas 272K token lebih murah di Sonnet 5.5. Halaman model GPT-6.1 Sol menetapkan harga seluruh permintaan pada 2x tarif input dan cache serta 1.5x tarif output. Sonnet 5.5 tetap menggunakan $2 input dan $10 output.
Sebagai contoh, prompt 400.000 token dengan jawaban 5.000 token tanpa cache berbiaya sekitar $1.68 pada GPT-6.1 Sol dan $0.85 pada Sonnet 5.5.
Apa yang diklaim setiap vendor, dan terhadap model mana
| OpenAI tentang GPT-6.1 Sol | Anthropic tentang Claude Sonnet 5.5 | |
|---|---|---|
| Dibandingkan dengan | GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 | Sonnet 5, Opus 5.5, GPT-6 Sol |
| Termasuk model lain | Tidak | Tidak; GPT-6.1 Sol belum tersedia saat perbandingan dibuat |
| Headline | “Kecerdasan mendekati Astra” dengan seperlima harga token standar Astra | 30%+ lebih cepat dari Sonnet 5, hingga 30% lebih murah per tugas |
| Siapa yang menjalankan angka | OpenAI; hasil kompetitor dari laporan publik sesuai catatan kaki | Anthropic, Cognition, Cursor, Artificial Analysis, dan Surge AI untuk tolok ukur tertentu |
Postingan peluncuran GPT-6.1 Sol dari OpenAI menyebut hasil berikut:
- AutomationBench 1.0.6, usaha medium: +2.2 poin persentase di atas Opus 5.5 dengan biaya sekitar sepertiga, serta +4.8 poin persentase di atas GPT-6 Sol.
- Terminal-Bench Science 0.1, usaha maksimal: $5.47 per tugas, dibanding $23.21 untuk Opus 5.5. GPT-6 Astra tetap mencetak skor tertinggi, 68.1%.
- OSWorld 2.0 offline, usaha maksimal: +7 poin persentase di atas GPT-6 Sol dengan biaya kurang dari separuh.
Postingan peluncuran Sonnet 5.5 dari Anthropic menyertakan GPT-6 Sol sebagai pembanding:
-
FrontierCode 1.1, dijalankan oleh Cognition: Sonnet 5.5 mendapat 52.1% pada
xhighdan 46.2% padamax, dibanding 49.3% untuk GPT-6 Sol. Pada usahahigh, Anthropic menyatakan Sonnet 5.5 menyamai skor terbaik GPT-6 Sol dengan biaya sekitar seperlima. - GDPval-AA v2.1 dan AA-Briefcase v1.1, dijalankan oleh Artificial Analysis: 1844 versus 1487, serta 1811 versus 1483.
Rincian tolok ukur Sonnet 5.5 mencakup tabel Anthropic lainnya.
Jangan menyatukan angka dari grafik yang berbeda tanpa memeriksa konfigurasi. Contohnya:
- OpenAI menjalankan AutomationBench 1.0.6 pada usaha
mediumdalam harness miliknya. - Ringkasan kartu sistem Anthropic menggunakan usaha maksimal untuk model Claude: Sonnet 5.5 44.7, Opus 5.5 42.5, dan GPT-6 Sol 32.0.
- Anthropic melaporkan Sonnet 5.5 sebesar 59.9% pada Terminal-Bench Science, tetapi teks OpenAI tidak memberikan skor mentah GPT-6.1 Sol.
- OpenAI menggunakan OSWorld 2.0 offline, sedangkan Anthropic menggunakan OSWorld 2.1.
Perbandingan GPT-6 Sol vs Claude Opus 5.5 menghadapi masalah yang sama: konfigurasi benchmark tidak selalu setara.
Apa yang diukur pihak ketiga pada GPT-6 Sol, bukan 6.1
Perbandingan pihak ketiga yang tersedia masih memasangkan Sonnet 5.5 dengan GPT-6 Sol. Salah satu yang paling lengkap adalah Artificial Analysis, melalui Intelligence Index v4.3.2 yang menggabungkan 10 evaluasi.
| Usaha | Indeks Sonnet 5.5 | Biaya Sonnet 5.5 per tugas | Indeks GPT-6 Sol | Biaya GPT-6 Sol per tugas |
|---|---|---|---|---|
medium |
41 | $0.59 | 40 | $0.25 |
high |
47 | $1.08 | 43 | $0.38 |
xhigh |
52 | $2.74 | 44 | $0.52 |
max |
56 | $7.60 | 48 | $1.05 |
Pada usaha maksimal, halaman yang sama mengukur:
- Sonnet 5.5: 138 token output per detik
- GPT-6 Sol: 76 token output per detik
Sonnet 5.5 mendapat skor lebih tinggi dan berbiaya lebih mahal per tugas di seluruh tingkat usaha tersebut, meskipun harga daftar keduanya sama. Perbedaannya berasal dari konsumsi token per tugas.
Contoh perbandingan yang lebih relevan daripada membandingkan usaha dengan nama sama:
- Sonnet 5.5 pada
high: indeks 47 dengan biaya $1.08 per tugas. - GPT-6 Sol pada
max: indeks 48 dengan biaya $1.05 per tugas.
Grafik Anthropic juga menunjukkan pola yang berbeda tergantung benchmark:
- Pada AA-Briefcase, GPT-6 Sol lebih murah per tugas pada setiap tingkat usaha, misalnya $0.34 versus $1.64 pada
medium, tetapi Sonnet 5.5 mencetak skor lebih tinggi. - Pada FrontierCode, Sonnet 5.5 pada
highmencapai 49.4% seharga $0.42 per tugas, dibanding 49.3% GPT-6 Sol padamaxseharga $2.07.
Semua angka ini masih menggunakan GPT-6 Sol. OpenAI menyatakan GPT-6.1 Sol mengungguli GPT-6 Sol pada usaha yang sama atau lebih rendah pada beberapa benchmark, sehingga angka pihak ketiga dapat berubah setelah GPT-6.1 Sol diuji.
Di mana masing-masing kemungkinan lebih kuat
GPT-6.1 Sol
OpenAI memosisikan GPT-6.1 Sol untuk pengodean kompleks, penggunaan komputer, dan pekerjaan profesional yang membutuhkan performa mendekati Astra dengan biaya lebih rendah.
Gunakan GPT-6.1 Sol sebagai kandidat utama jika Anda membutuhkan:
- Otomatisasi agen.
- Penggunaan komputer.
- Tugas sains.
- Prompt sistem panjang yang dapat dipakai ulang melalui cache.
- Latensi lebih rendah melalui tingkat Cepat berbayar.
Claude Sonnet 5.5
Anthropic memosisikan Sonnet 5.5 untuk tugas sehari-hari dengan ruang lingkup jelas, perbaikan bug, serta pembuatan dokumen, slide, dan spreadsheet yang dipoles. Anthropic juga menyatakan Opus 5.5 tetap lebih kuat untuk pekerjaan kompleks dan terbuka; lihat Sonnet 5.5 vs Opus 5.5.
Gunakan Sonnet 5.5 sebagai kandidat utama jika Anda membutuhkan:
- Pengodean agen.
- Pekerjaan pengetahuan dan dokumen terstruktur.
- Prompt sangat panjang, terutama di atas 272K token input.
- Integrasi melalui Bedrock, Google Cloud, atau Microsoft Foundry.
Hindari perbandingan yang naif
Dua hal dapat membuat hasil pengujian menyesatkan:
-
Usaha default berbeda. GPT-6.1 Sol memakai
mediumsebagai default, sedangkan Sonnet 5.5 memakaihighpada API. Uji level yang setara, bukan hanya nama parameter yang sama. -
Sampling tidak dapat dipakai sembarangan. Sonnet 5.5 mengembalikan HTTP 400 bila
temperature,top_p, atautop_ktidak default. Panduan GPT-6 OpenAI menyarankan menurunkantemperaturedantop_pketika effort bukannone.
Untuk mengukur variasi, jalankan setiap tugas beberapa kali dan bandingkan median biaya, latensi, serta tingkat keberhasilan.
Jalankan perbandingan sendiri di Apidog
Pilih 20–50 tugas dari trafik riil Anda. Prioritaskan tugas dengan hasil yang dapat diverifikasi, misalnya JSON, klasifikasi label, SQL, patch kode, atau field terstruktur.
1. Buat environment
Di Apidog, buat environment dan simpan variabel berikut sebagai rahasia:
OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
Tambahkan juga variabel data seperti:
prompt
expected
2. Simpan request OpenAI
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{
"model": "gpt-6.1-sol",
"reasoning": {
"effort": "{{EFFORT}}"
},
"max_output_tokens": 25000,
"input": "{{prompt}}"
}
Lihat referensi Responses untuk detail endpoint.
3. Simpan request Anthropic
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{
"model": "claude-sonnet-5-5",
"max_tokens": 25000,
"output_config": {
"effort": "{{EFFORT}}"
},
"messages": [
{
"role": "user",
"content": "{{prompt}}"
}
]
}
Lihat referensi Messages. Bentuk request kedua API memang berbeda; perbandingan format API menjelaskan pola perbedaannya.
4. Tambahkan assertion respons
Tambahkan pemeriksaan struktur respons sebelum mengevaluasi jawaban terhadap kolom expected.
| Periksa | Respons OpenAI | Respons Anthropic |
|---|---|---|
| Selesai normal |
$.status sama dengan completed
|
$.stop_reason sama dengan end_turn
|
| Jawaban ada |
$.output[*].type berisi message
|
$.content[*].type berisi text
|
| Token output, termasuk penalaran | $.usage.output_tokens |
$.usage.output_tokens |
| Pembacaan cache | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| Penulisan cache | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
Setelah itu, tambahkan assertion khusus tugas. Contoh untuk output JSON:
- Respons dapat diparse sebagai JSON
- $.category sama dengan {{expected_category}}
- $.confidence lebih besar atau sama dengan 0.8
5. Hitung biaya per respons
Gunakan data usage untuk menghitung biaya aktual.
Untuk OpenAI:
-
input_tokensmencakup token cache read dan cache write. - Kurangi token tersebut sebelum menerapkan tarif input standar $2 per juta token.
- Terapkan tarif cache read dan cache write secara terpisah.
- Terapkan aturan premium jika total input melampaui 272K token.
Lihat caching prompt OpenAI.
Untuk Anthropic:
-
input_tokenshanya menghitung token setelah breakpoint cache terakhir. - Gunakan
cache_read_input_tokensdancache_creation_input_tokensuntuk menghitung komponen cache.
Lihat caching prompt Anthropic.
6. Jalankan dataset melalui Apidog CLI
Simpan dataset sebagai prompts.csv. Jaga nilai prompt dalam satu baris dan hindari tanda kutip ganda yang tidak di-escape.
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Ulangi untuk setiap level usaha yang ingin dibandingkan:
# GPT-6.1 Sol dan Sonnet 5.5 pada medium
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
# GPT-6.1 Sol dan Sonnet 5.5 pada high
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=high" -r cli,junit
Hitung metrik berikut per model dan tingkat usaha:
biaya per tugas berhasil = total pengeluaran / jumlah tugas berhasil
Tambahkan juga:
- Tingkat keberhasilan.
- Median latensi.
- Jumlah token input, output, cache read, dan cache write.
- Skor kualitas berdasarkan assertion atau penilaian manusia.
Untuk detail request, lihat panduan API GPT-6.1 Sol dan cara menggunakan API Claude Sonnet 5.5.
FAQ
Apakah GPT-6.1 Sol lebih murah dari Claude Sonnet 5.5?
Harga daftar keduanya sama: $2 input dan $10 output per 1 juta token. GPT-6.1 Sol lebih murah untuk cache read, sedangkan Sonnet 5.5 lebih murah untuk prompt di atas 272K token input. Biaya akhir bergantung pada token yang digunakan per tugas.
Mana yang lebih baik dalam pengodean?
Belum ada benchmark bersama yang membandingkan GPT-6.1 Sol dengan Sonnet 5.5 secara langsung. Anthropic melaporkan Sonnet 5.5 unggul atas GPT-6 Sol di FrontierCode, sedangkan OpenAI melaporkan GPT-6.1 Sol meningkatkan skor DeepSWE terbaik GPT-6 Sol sebesar 6.4 poin persentase. Uji pada repository dan workflow Anda sendiri.
Mana yang lebih cepat?
Artificial Analysis mengukur Sonnet 5.5 pada 138 token per detik dan GPT-6 Sol pada 76 token per detik, keduanya pada usaha maksimal. Belum ada angka pihak ketiga untuk GPT-6.1 Sol.
Apakah ada yang gratis?
GPT-6.1 Sol tidak memiliki tingkat gratis. Sonnet 5.5 tersedia di aplikasi obrolan Claude.ai, tetapi API tetap menagih per token. Lihat cara menggunakan Claude Sonnet 5.5 secara gratis.
Pilih dengan menjalankan keduanya
Ambil sepuluh tugas dari backlog Anda, jalankan kedua model pada medium dan high, lalu bandingkan:
- Tingkat tugas berhasil.
- Biaya per tugas berhasil.
- Latensi.
- Kualitas output berdasarkan assertion yang sama.
- Konsumsi cache dan token output.
Unduh Apidog untuk menyimpan kedua request dalam satu skenario yang dapat dijalankan ulang ketika Artificial Analysis menerbitkan hasil GPT-6.1 Sol atau ketika vendor merilis snapshot baru.
Top comments (0)