DEV Community

Cover image for Panduan Prompt Claude Opus 5: Jangan Minta Periksa Ulang Lagi
Walse
Walse

Posted on • Originally published at apidog.com

Panduan Prompt Claude Opus 5: Jangan Minta Periksa Ulang Lagi

Sebagian besar panduan migrasi memberi tahu Anda apa yang rusak dalam kode Anda. Yang ini membahas apa yang rusak dalam prompt Anda.

Coba Apidog hari ini

Claude Opus 5 diluncurkan pada 24 Juli 2026, dan Anthropic merilis panduan prompt khusus bersamanya. Panduan tersebut mendokumentasikan sesuatu yang patut diperhatikan: beberapa instruksi yang membuat Opus 4.8 lebih baik justru membuat Opus 5 lebih buruk. Bukan lebih buruk secara halus. Terukur lebih mahal, terukur lebih bertele-tele, dan dalam satu kasus benar-benar rusak.

Alasannya sederhana. Opus 5 sudah melakukan beberapa hal secara mandiri yang dulu harus Anda minta. Ketika prompt lama tetap meminta hal yang sama, instruksi tersebut bercampur dengan perilaku bawaan model. Anda mendapatkan verifikasi dua kali, bukan akurasi dua kali.

Panduan ini membahas setiap pergeseran perilaku yang didokumentasikan dengan cuplikan prompt yang dapat langsung Anda salin ke prompt sistem. Ini juga mencakup dua mode kegagalan saat pemikiran dinonaktifkan—satu-satunya area ketika prompt Opus 5 dapat menghasilkan output yang terlihat benar tetapi diam-diam merusak loop agen.

Jika Anda masih mengerjakan perubahan tingkat kode, panduan migrasi Opus 4.8 ke Opus 5 membahasnya secara terpisah. Untuk membandingkan perubahan perilaku ini dalam payload permintaan dan respons nyata, gunakan Apidog untuk mengirim prompt yang sama dengan konfigurasi berbeda dan membandingkan hasilnya.

Ringkasan singkat

Opus 5 lebih banyak memverifikasi, menulis, mendelegasikan, dan menjelaskan dirinya sendiri dibandingkan Opus 4.8. Prompt Opus 4.8 biasanya disetel untuk mendorong model ke arah perilaku tersebut. Pada Opus 5, prompt yang sama mendorong perilaku itu lebih jauh.

Karena itu, pekerjaan migrasinya terutama adalah pengurangan:

  • Hapus instruksi verifikasi global.
  • Tambahkan batas panjang output.
  • Batasi atau larang subagen.
  • Tetapkan cakupan perubahan secara eksplisit.
  • Hilangkan narasi koreksi jika output akan diproses mesin.

1. Hapus instruksi verifikasi Anda

Ini adalah perubahan paling penting.

Anthropic menyatakan bahwa Opus 5 memverifikasi pekerjaannya sendiri tanpa diminta. Model dapat membaca ulang output, memeriksa aritmetika, menjalankan ulang tes, dan mencari kasus ekstrem yang tidak Anda sebutkan.

Pada Opus 4.8, perilaku tersebut sering dipicu dengan instruksi seperti berikut:

Double-check your work before responding.
Verify each step before moving to the next one.
Review your answer for errors, then revise it.
Check your reasoning carefully.
Make sure the output is correct before returning it.
Enter fullscreen mode Exit fullscreen mode

Pada Opus 5, mempertahankan instruksi tersebut dapat memicu verifikasi berlebihan. Model melakukan verifikasi bawaan, lalu melakukan verifikasi tambahan yang Anda minta. Untuk alur agen panjang, token tambahan ini menjadi biaya nyata.

Langkah implementasi

Cari pola verifikasi global di prompt sistem Anda, lalu hapus.

Jika hanya ada satu langkah berisiko tinggi yang membutuhkan pemeriksaan eksplisit, batasi instruksi pada langkah itu:

Do not add general verification passes; you already verify by default.
The only exception: after writing the migration SQL, run it against the
schema dump once and report any mismatch. Do not re-verify anything else.
Enter fullscreen mode Exit fullscreen mode

Instruksi global seperti “verifikasi semuanya” adalah pengali biaya pada Opus 5. Satu pengecualian yang dibatasi adalah kontrol yang lebih aman.

Jika Anda melacak biaya API selama migrasi, pengungkit cache dan batch dalam perincian harga Opus 5 selaras dengan pendekatan ini. Lihat juga panduan memotong tagihan API Claude untuk pengungkit biaya yang lebih umum.

2. Minta keringkasan secara eksplisit

Respons default Opus 5 lebih panjang daripada Opus 4.8. Hal yang sama berlaku untuk artefak tertulis seperti laporan, ringkasan, dokumen desain, dan README.

Jangan mengandalkan parameter effort untuk menyelesaikan masalah ini.

effort mengontrol seberapa banyak model berpikir, bukan seberapa banyak model menulis. Menurunkan effort dari xhigh ke medium dapat mengurangi token pemikiran, sementara panjang respons yang terlihat tetap hampir sama.

Jika Anda menganggap effort sebagai pengatur verbositas, biaya API tidak akan berubah seperti yang Anda harapkan. Panduan parameter effort Opus 5 membahas perubahan pada setiap level.

Gunakan batas output yang terukur

Hindari instruksi longgar seperti “singkat saja”. Tentukan batas atas:

Response format: at most 150 words unless I ask for more.
No preamble, no restatement of my question, no summary at the end.
Lead with the answer, then the reasoning if it is needed.
Enter fullscreen mode Exit fullscreen mode

Untuk dokumen, batasi panjang sekaligus isi yang wajib dan dilarang:

Write the migration doc at 800 words maximum.
Include: the breaking changes, the fix for each, and a rollback step.
Exclude: background on the old system, a glossary, and a conclusion section.
If a section would exceed its share, cut examples before cutting steps.
Enter fullscreen mode Exit fullscreen mode

Untuk tugas yang berfokus pada kode, batasi komentar atau penjelasan:

Return the diff and nothing else.
No explanation of what you changed unless the change is non-obvious,
in which case one sentence above the hunk.
Enter fullscreen mode Exit fullscreen mode

3. Batasi delegasi subagen

Opus 5 lebih mudah mendelegasikan pekerjaan ke subagen dibandingkan Opus 4.8. Untuk tugas multi-bagian dalam framework yang mendukung pembentukan subagen, model dapat menyebarkan pekerjaan ke beberapa agen.

Itu kadang tepat, tetapi juga keputusan biaya dan latensi. Setiap subagen membawa konteks dan penggunaan token sendiri.

Larang subagen untuk tugas kecil

Do not spawn subagents for this task. Handle it in this conversation.
Enter fullscreen mode Exit fullscreen mode

Batasi jumlah subagen untuk tugas paralel

You may delegate to at most 2 subagents, and only for independent
file-level work that can run in parallel.
Do research, planning, and final synthesis yourself in this thread.
Enter fullscreen mode Exit fullscreen mode

Hindari delegasi demi delegasi, misalnya membuat subagen hanya untuk membaca satu file atau mengambil keputusan yang konteksnya sudah tersedia di thread utama.

Jika Anda memang membangun workflow berbasis subagen, panduan membuat subagen Kode Claude membahas pembatasan di sisi framework.

4. Batasi cakupan secara eksplisit pada tugas sempit

Opus 5 cenderung memperluas cakupan tugas.

Misalnya, ketika diminta memperbaiki tes gagal, model mungkin juga:

  • melakukan refaktor helper yang dipanggil tes;
  • memperbarui tanda tipe;
  • menambahkan kasus uji;
  • merapikan kode di sekitar perubahan.

Pada tugas eksploratif, perilaku ini bisa berguna. Pada perubahan bedah, ini menambah diff yang perlu direview dan memperbesar jangkauan dampak.

Tetapkan batasan file dan perubahan

Scope: change only the retry-count constant in src/client/http.ts.
Do not refactor surrounding code, do not rename anything, do not add
tests, do not update docs. If you believe another change is required,
stop and tell me instead of making it.
Enter fullscreen mode Exit fullscreen mode

Klausa terakhir penting. Tanpanya, model harus memilih antara mengabaikan masalah atau tetap melakukan perubahan tambahan. Dengan klausa tersebut, model dapat menandai risiko tanpa mengubah cakupan pekerjaan.

5. Matikan narasi koreksi jika tidak diperlukan

Opus 5 lebih sering menarasikan koreksinya dibandingkan Opus 4.8. Saat mengubah pendekatan di tengah respons, model dapat menjelaskan bahwa pendekatan sebelumnya salah, alasan perubahan, dan hasil revisinya.

Untuk pekerjaan interaktif, ini berguna. Untuk pipeline yang mengalirkan respons ke parser, UI, atau model lain, narasi tambahan tersebut dapat merusak format output.

Gunakan instruksi berikut:

Do not narrate corrections or changes of approach.
Return only the final answer. If you revised your thinking, that
revision belongs in your reasoning, not in the response.
Enter fullscreen mode Exit fullscreen mode

Jika respons masuk ke penyimpanan atau pipeline terstruktur, pasangkan instruksi ini dengan output terstruktur agar bentuk respons dipaksakan oleh skema, bukan hanya diminta melalui prompt.

Mode kegagalan saat pemikiran dinonaktifkan

Semua bagian sebelumnya adalah masalah penyetelan. Bagian ini adalah masalah kebenaran.

Anthropic mendokumentasikan dua artefak yang kadang muncul ketika pemikiran dinonaktifkan melalui:

{
  "thinking": {
    "type": "disabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

Keduanya perlu dipahami sebelum Anda meluncurkan agen ke produksi.

Panggilan alat ditulis sebagai teks biasa

Model dapat mengeluarkan sesuatu yang terlihat seperti panggilan alat, tetapi muncul sebagai teks di badan respons, bukan blok tool_use terstruktur.

Akibatnya:

  1. Tidak ada alat yang dieksekusi.
  2. Loop agen tidak melihat panggilan alat.
  3. Teks bocor tetap masuk ke riwayat percakapan.
  4. Giliran berikutnya dapat membaca teks tersebut seolah tindakan sudah selesai.
  5. Kegagalan menumpuk pada setiap giliran.

Dalam chat satu giliran, Anda mungkin langsung menyadarinya. Dalam loop agen, masalah ini bisa baru terlihat beberapa giliran setelah penyebab awalnya.

Tag XML internal muncul di output

Tag seperti <thinking> dapat muncul dalam respons yang terlihat pengguna.

Ini bukan hanya masalah tampilan. Tag tersebut juga dapat mengganggu:

  • rendering HTML;
  • parser berbasis XML atau HTML;
  • output terstruktur;
  • validasi respons pipeline.

Jangan mencoba memperbaikinya dengan menambahkan prompt seperti “jangan pernah keluarkan tag <thinking>”. Menyebut tag tersebut di prompt justru menempatkan urutan token itu dalam konteks dan dapat meningkatkan kemungkinan kebocoran.

Mitigasi yang direkomendasikan

Jangan nonaktifkan pemikiran. Pertahankan pemikiran aktif dan turunkan effort untuk mengontrol biaya:

{
  "model": "claude-opus-5",
  "max_tokens": 4096,
  "output_config": { "effort": "low" },
  "messages": [
    { "role": "user", "content": "..." }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Konfigurasi ini memberi Anda sisi biaya yang lebih rendah tanpa artefak dari disabled-thinking.

Perhatikan juga:

  • Menggabungkan thinking: {type: "disabled"} dengan effort xhigh atau max mengembalikan kode 400.
  • Penonaktifan pemikiran dibatasi hingga high effort.
  • Pemikiran sekarang aktif secara default.
  • Permintaan yang hanya menghilangkan bidang thinking akan menggunakan pemikiran adaptif, bukan berjalan tanpa pemikiran seperti pada Opus 4.8.

Jika Anda benar-benar harus menonaktifkan pemikiran, tambahkan pemeriksaan defensif di loop agen. Tolak respons asisten yang berisi string berbentuk panggilan alat tetapi tidak memiliki blok panggilan alat terstruktur sebelum respons tersebut ditambahkan ke riwayat percakapan.

Gagal secara tegas lebih aman daripada membiarkan panggilan hantu masuk ke transkrip.

Uji perubahan, jangan menebak

Perubahan prompt sulit dievaluasi hanya dengan membacanya. Perilaku seperti panjang respons, jumlah verifikasi, dan penggunaan subagen muncul sebagai jumlah token serta struktur payload.

Cara yang jujur untuk mengevaluasi perubahan adalah mengirim permintaan yang sama dan membandingkan hasilnya.

Tampilan perbandingan request API

Anda dapat menyiapkannya di Apidog, platform pengembangan dan pengujian API all-in-one:

  1. Buat satu request ke endpoint Anthropic Messages dengan "model": "claude-opus-5". Simpan API key sebagai environment variable, bukan di body request.
  2. Simpan prompt sistem Opus 4.8 lama dan prompt Opus 5 yang sudah dipangkas sebagai dua request terpisah dengan input identik.
  3. Bandingkan blok usage pada setiap respons. Token output menunjukkan apakah batas keringkasan bekerja; token input dan field cache menunjukkan apakah edit prompt merusak prefiks cache.
  4. Duplikasi request pada beberapa level effort untuk melihat bahwa token pemikiran turun, sementara panjang output yang terlihat dapat tetap sama.
  5. Periksa respons streaming untuk memastikan panggilan alat datang sebagai blok tool_use terstruktur, bukan teks biasa.

Langkah kelima menangkap kegagalan panggilan alat dalam teks sebelum mencapai produksi. Unduh Apidog untuk menjalankan perbandingan berdampingan, lalu lihat panduan API Opus 5 untuk bentuk request lengkap.

Batas atas yang jujur

Penting untuk menyatakannya dengan jelas: Opus 5 bukan puncak tumpukan Claude.

Fable 5 tetap mempertahankan sebutan “yang paling mampu dirilis secara luas”, sementara Opus 5 masih tertinggal dari Mythos 5 dalam eksploitasi keamanan siber dan penelitian biologi otonom. Anthropic menyatakan hal ini dalam postingan peluncurannya.

Pembingkaian yang akurat adalah kemampuan kelas garis depan dengan setengah harga garis depan, dengan batas atas yang disebutkan di atasnya.

Klaim benchmark peluncuran—Frontier-Bench, ARC-AGI 3, OSWorld 2.0, dan CursorBench—adalah angka Anthropic sendiri dan belum direproduksi secara independen pada 25 Juli 2026. Perlakukan sebagai laporan vendor, lalu jalankan evaluasi menggunakan prompt dan workload yang benar-benar Anda gunakan.

Merangkai semuanya

Prompt sistem Opus 5 yang dipangkas untuk tugas agen sensitif biaya dapat terlihat seperti ini:

Do not add verification passes; you verify by default.
Responses: 150 words maximum, no preamble, no closing summary.
Do not spawn subagents. Handle this in one thread.
Stay strictly within the task I state. If another change seems
required, stop and tell me rather than making it.
Do not narrate corrections or changes of approach.
Enter fullscreen mode Exit fullscreen mode

Enam baris, lima di antaranya adalah batasan. Tidak ada yang meminta model untuk “berusaha lebih keras”.

Itulah pergeserannya:

  • Pada Opus 4.8, prompt digunakan untuk menaikkan batas bawah perilaku model.
  • Pada Opus 5, prompt digunakan untuk menetapkan batas atas perilaku model.

Mulai dari baseline tersebut, lalu lakukan penyapuan effort pada evaluasi Anda sendiri. Jangan sekadar membawa konfigurasi Opus 4.8 karena levelnya telah dikalibrasi ulang.

Untuk detail parameter, lihat panduan parameter effort. Untuk workflow di editor, lihat menggunakan Opus 5 di Claude Code. Untuk gambaran model, mulai dari apa itu Claude Opus 5. Ikhtisar model Anthropic menyediakan tabel spesifikasi terkini.

FAQ

Haruskah saya benar-benar menghapus “periksa ulang pekerjaan Anda” dari prompt saya?

Ya. Panduan prompt Anthropic menyatakan bahwa Opus 5 memverifikasi tanpa diminta, dan instruksi verifikasi lama dapat menyebabkan verifikasi berlebihan. Hapus aturan global. Jika satu langkah spesifik benar-benar membutuhkan pemeriksaan eksplisit, batasi instruksi hanya untuk langkah itu.

Mengapa Opus 5 tetap bertele-tele pada effort rendah?

Karena effort mengontrol pemikiran, bukan panjang output yang terlihat. Menurunkan effort dapat mengurangi token penalaran, sementara respons tetap memiliki panjang yang hampir sama. Tetapkan batas kata atau format langsung di prompt.

Bagaimana cara menghentikan Opus 5 membuat subagen?

Instruksikan secara langsung:

Do not spawn subagents for this task. Handle it in this conversation.
Enter fullscreen mode Exit fullscreen mode

Jika beberapa delegasi memang berguna, beri batas numerik dan batasi hanya untuk pekerjaan paralel yang independen.

Mengapa saya melihat tag <thinking> di output?

Artefak tersebut kadang muncul ketika pemikiran dinonaktifkan. Jangan menambahkan instruksi prompt yang menyebut tag tersebut karena hal itu dapat membuat kebocoran lebih mungkin terjadi. Rekomendasi Anthropic adalah membiarkan pemikiran aktif dan menggunakan effort lebih rendah untuk mengontrol biaya.

Apa yang terjadi jika panggilan alat kembali sebagai teks biasa?

Tidak ada alat yang dieksekusi. Teks bocor lalu tetap berada di riwayat percakapan, sehingga giliran berikutnya dapat memperlakukannya sebagai tindakan yang sudah selesai. Validasi setiap respons asisten sebelum menambahkannya ke riwayat, dan lebih pilih mempertahankan pemikiran aktif daripada menonaktifkannya.

Top comments (0)