DEV Community

Cover image for Diseño de prompts para Claude Opus 5: Evita la doble verificación
Roobia
Roobia

Posted on • Originally published at apidog.com

Diseño de prompts para Claude Opus 5: Evita la doble verificación

La mayoría de las guías de migración te dicen qué se rompe en tu código. Esta trata sobre lo que se rompe en tus prompts.

Prueba Apidog hoy

Claude Opus 5 se lanzó el 24 de julio de 2026, y Anthropic publicó una guía de prompting dedicada junto a él. La guía documenta un cambio importante: varias instrucciones que mejoraban Opus 4.8 empeoran Opus 5. El resultado puede ser más costo, más verbosidad y, en un caso, una salida que rompe activamente un bucle de agente.

La razón es simple: Opus 5 ya realiza por defecto varias tareas que antes debías solicitar explícitamente. Si tu prompt heredado vuelve a pedirlas, la instrucción se combina con el comportamiento nativo del modelo. No obtienes el doble de precisión; obtienes pases de verificación duplicados.

Esta guía recorre cada cambio de comportamiento documentado e incluye fragmentos que puedes copiar a tu prompt del sistema. También cubre los dos modos de fallo que aparecen al deshabilitar el pensamiento, el único caso donde un prompt de Opus 5 puede devolver una salida aparentemente correcta y corromper silenciosamente un bucle de agente.

Si todavía trabajas en cambios a nivel de código, la guía de migración de Opus 4.8 a Opus 5 los cubre por separado. Para comparar el mismo prompt con configuraciones diferentes mediante solicitudes reales, puedes usar Apidog.

El resumen de una línea

Opus 5 verifica más, escribe más, delega más y explica más que Opus 4.8. Tus prompts de Opus 4.8 estaban ajustados para empujar al modelo hacia esos comportamientos. Ahora puede excederlos.

El trabajo de migración es principalmente sustractivo:

  • Elimina instrucciones de verificación global.
  • Añade límites explícitos de longitud.
  • Restringe el uso de subagentes.
  • Define el alcance permitido.
  • Desactiva la narración de correcciones cuando la salida vaya a un parser o pipeline.

1. Elimina las instrucciones de verificación global

Anthropic indica que Opus 5 verifica su propio trabajo sin necesidad de solicitarlo. Puede releer lo escrito, comprobar cálculos, volver a ejecutar pruebas o buscar casos límite.

En Opus 4.8, era común forzar ese comportamiento con instrucciones como estas:

Double-check your work before responding.
Verify each step before moving to the next one.
Review your answer for errors, then revise it.
Check your reasoning carefully.
Make sure the output is correct before returning it.
Enter fullscreen mode Exit fullscreen mode

En Opus 5, mantener esas líneas puede provocar sobreverificación. El modelo ejecuta sus comprobaciones predeterminadas y, además, las que ordenaste explícitamente. En ejecuciones largas de agentes, esos tokens adicionales se convierten en costo real.

Qué hacer

Busca esos patrones en tus prompts de sistema y elimínalos.

Si existe una operación realmente crítica, limita la verificación a ese único paso:

Do not add general verification passes; you already verify by default.
The only exception: after writing the migration SQL, run it against the
schema dump once and report any mismatch. Do not re-verify anything else.
Enter fullscreen mode Exit fullscreen mode

La diferencia es importante:

  • “Verifica todo” es una regla global y un multiplicador de costo.
  • “Verifica este paso una vez” es un control acotado.

Si estás monitorizando el gasto de la API durante la migración, combina este ajuste con las palancas de caché y lote del desglose de precios de Opus 5. Para optimizaciones generales, consulta la guía para reducir la factura de la API de Claude.

2. Solicita concisión explícitamente

Las respuestas predeterminadas de Opus 5 son más largas que las de Opus 4.8. Esto también afecta a artefactos generados, como informes, resúmenes, documentos de diseño y README.

No intentes resolverlo únicamente bajando effort.

El parámetro effort controla cuánto piensa el modelo, no cuánto texto visible genera. Cambiar de xhigh a medium puede reducir tokens de pensamiento, pero la longitud de la respuesta seguirá siendo similar.

La longitud debe controlarse desde el prompt.

Limita la respuesta visible

Response format: at most 150 words unless I ask for more.
No preamble, no restatement of my question, no summary at the end.
Lead with the answer, then the reasoning if it is needed.
Enter fullscreen mode Exit fullscreen mode

Limita entregables escritos

Write the migration doc at 800 words maximum.
Include: the breaking changes, the fix for each, and a rollback step.
Exclude: background on the old system, a glossary, and a conclusion section.
If a section would exceed its share, cut examples before cutting steps.
Enter fullscreen mode Exit fullscreen mode

Limita la explicación en tareas de código

Return the diff and nothing else.
No explanation of what you changed unless the change is non-obvious,
in which case one sentence above the hunk.
Enter fullscreen mode Exit fullscreen mode

Para entender qué cambia en cada nivel, consulta la guía del parámetro de esfuerzo de Opus 5.

3. Limita la delegación de subagentes

Opus 5 delega en subagentes con más facilidad que Opus 4.8. Ante una tarea compuesta y un arnés compatible con generación de subagentes, puede expandir el trabajo.

Esto puede ser útil, pero también es una decisión de costo y latencia: cada subagente tiene su propio contexto y consumo de tokens.

Prohíbe subagentes cuando no aporten valor

Do not spawn subagents for this task. Handle it in this conversation.
Enter fullscreen mode Exit fullscreen mode

Permite una cantidad limitada cuando el paralelismo sea útil

You may delegate to at most 2 subagents, and only for independent
file-level work that can run in parallel.
Do research, planning, and final synthesis yourself in this thread.
Enter fullscreen mode Exit fullscreen mode

Evita delegaciones innecesarias, por ejemplo:

  • Crear un subagente para leer un único archivo.
  • Delegar una decisión para la que el hilo principal ya tiene contexto.
  • Crear subagentes para planificación o síntesis cuando no hay trabajo paralelo independiente.

Si diseñas flujos con subagentes deliberadamente, la guía para crear subagentes de código de Claude cubre cómo delimitarlos desde el arnés.

4. Restringe explícitamente el alcance

Opus 5 puede expandir el alcance de una tarea. Si le pides arreglar una prueba fallida, podría también refactorizar una función auxiliar, actualizar tipos y añadir casos de prueba. Si le pides renombrar una variable, podría reorganizar el código circundante.

En una tarea quirúrgica, esto produce diffs más grandes, revisiones más lentas y mayor radio de impacto.

Define qué puede cambiar y qué está prohibido

Scope: change only the retry-count constant in src/client/http.ts.
Do not refactor surrounding code, do not rename anything, do not add
tests, do not update docs. If you believe another change is required,
stop and tell me instead of making it.
Enter fullscreen mode Exit fullscreen mode

La última cláusula es especialmente útil. Da al modelo una salida válida cuando detecta un problema fuera del alcance:

  • Puede señalar la dependencia.
  • No necesita modificar archivos no autorizados.
  • Recibes un diff mínimo y una observación explícita.

5. Desactiva la narración de correcciones cuando no la necesites

Opus 5 narra sus correcciones más que Opus 4.8. Cuando cambia de enfoque, puede explicar qué intento anterior era incorrecto y por qué eligió otra alternativa.

Esto es útil en trabajo interactivo. En un pipeline, una respuesta que alimenta un parser, una UI o otro modelo, esa narración puede contaminar un campo que debería contener solo el resultado final.

Devuelve únicamente la respuesta final

Do not narrate corrections or changes of approach.
Return only the final answer. If you revised your thinking, that
revision belongs in your reasoning, not in the response.
Enter fullscreen mode Exit fullscreen mode

Si envías resultados a almacenamiento estructurado, combina esta instrucción con salidas estructuradas para imponer el formato en lugar de depender solo del prompt.

Modos de fallo con el pensamiento deshabilitado

Todo lo anterior es ajuste de comportamiento. Esta sección trata de corrección.

Anthropic documenta dos artefactos que pueden aparecer ocasionalmente en Opus 5 cuando deshabilitas el pensamiento mediante:

{
  "thinking": {
    "type": "disabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

Debes conocerlos antes de implementar un agente.

Llamadas a herramientas emitidas como texto plano

El modelo puede producir algo que parece una llamada a herramienta, pero incluirlo como texto dentro de la respuesta en lugar de como un bloque estructurado tool_use.

En ese caso:

  1. No se ejecuta ninguna herramienta.
  2. El bucle del agente no detecta una llamada válida.
  3. El texto filtrado queda en el historial.
  4. Los siguientes turnos pueden interpretar ese texto como una acción ya realizada.

En un chat de una sola interacción, probablemente lo detectarías. En un bucle de agente, puede acumularse durante varios turnos antes de ser visible.

Etiquetas XML internas en la salida visible

También pueden aparecer etiquetas como <thinking> en la respuesta visible.

Esto es problemático si:

  • Renderizas respuestas como HTML.
  • Analizas la salida para extraer estructura.
  • Tienes una interfaz que espera texto limpio.

No intentes solucionar este problema escribiendo una regla que mencione literalmente esas etiquetas. Incluir la secuencia de tokens en el contexto puede aumentar la probabilidad de que aparezca.

Mitigación recomendada

La recomendación de Anthropic no es un cambio de prompt: mantén el pensamiento habilitado y controla el costo mediante un nivel de esfuerzo más bajo.

{
  "model": "claude-opus-5",
  "max_tokens": 4096,
  "output_config": { "effort": "low" },
  "messages": [
    { "role": "user", "content": "..." }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Esto permite usar el extremo económico del rango sin introducir los artefactos asociados al pensamiento deshabilitado.

También evita una incompatibilidad: en Opus 5, combinar thinking: {type: "disabled"} con esfuerzo xhigh o max devuelve un error 400. Deshabilitar el pensamiento está limitado a un esfuerzo high.

Además, el pensamiento está activado por defecto. Una solicitud que omite el campo thinking usa pensamiento adaptativo, en lugar de ejecutarse sin pensamiento como podía ocurrir en Opus 4.8.

Si debes deshabilitar el pensamiento por un requisito estricto, añade una comprobación defensiva en tu bucle de agente:

  • Inspecciona el texto del turno del asistente antes de añadirlo al historial.
  • Rechaza respuestas que contengan una cadena con forma de llamada a herramienta no ejecutada.
  • Haz que el flujo falle de forma visible en lugar de permitir que una llamada fantasma entre en la transcripción.

Prueba los cambios en lugar de adivinar

No puedes evaluar estos cambios leyendo el prompt. La longitud de respuesta, los pases de verificación y el número de subagentes se reflejan en recuentos de tokens y en la estructura de la carga útil.

La forma correcta de validar la migración es enviar solicitudes equivalentes y comparar resultados.

Comparación de solicitudes y respuestas de API

Puedes configurarlo en Apidog, una plataforma todo en uno para desarrollo y pruebas de API:

  1. Crea una solicitud al endpoint de mensajes de Anthropic con "model": "claude-opus-5". Guarda la clave API como variable de entorno, no en el cuerpo de la solicitud.
  2. Guarda tu prompt de sistema antiguo de Opus 4.8 y la versión recortada para Opus 5 como dos solicitudes separadas con la misma entrada.
  3. Compara el bloque usage de cada respuesta. Los tokens de salida muestran si se aplicó el límite de concisión; los tokens de entrada y los campos de caché muestran si editaste un prefijo cacheable.
  4. Duplica la solicitud con distintos niveles de esfuerzo para comprobar cómo disminuyen los tokens de pensamiento mientras la longitud visible se mantiene.
  5. Inspecciona la respuesta de streaming y confirma que las llamadas a herramientas llegan como bloques tool_use, no como texto plano.

El paso 5 detecta el fallo de llamadas a herramientas en texto antes de que llegue a producción. Puedes descargar Apidog para ejecutar estas comparaciones lado a lado, y consultar el tutorial de la API de Opus 5 para revisar la forma completa de la solicitud.

El techo honesto

Conviene decirlo claramente: Opus 5 no es la cima de la pila de Claude.

Fable 5 conserva la designación de “el más capaz ampliamente lanzado”, y Opus 5 sigue por detrás de Mythos 5 en explotación de ciberseguridad e investigación de biología autónoma. Anthropic indica ambas cosas en su propia publicación de lanzamiento.

El encuadre preciso es una capacidad de clase frontera a la mitad del precio de frontera, con un techo explícitamente definido por encima.

Las afirmaciones de los benchmarks de lanzamiento —Frontier-Bench, ARC-AGI 3, OSWorld 2.0 y CursorBench— son cifras proporcionadas por Anthropic y no habían sido reproducidas de forma independiente hasta el 25 de julio de 2026. Trátalas como datos del proveedor y ejecuta tus propias evaluaciones sobre los prompts que realmente vayas a desplegar.

Armándolo todo

Un prompt de sistema de Opus 5 para una tarea de agente sensible al costo puede quedar así:

Do not add verification passes; you verify by default.
Responses: 150 words maximum, no preamble, no closing summary.
Do not spawn subagents. Handle this in one thread.
Stay strictly within the task I state. If another change seems
required, stop and tell me rather than making it.
Do not narrate corrections or changes of approach.
Enter fullscreen mode Exit fullscreen mode

Son seis líneas. Cinco son restricciones. Ninguna pide al modelo que se esfuerce más.

Ese es el cambio de mentalidad:

  • En Opus 4.8, el prompt buscaba elevar un piso.
  • En Opus 5, el prompt debe establecer un techo.

Empieza con esta base y ejecuta un barrido de esfuerzo en tus propias evaluaciones. No migres directamente las configuraciones de 4.8: los niveles fueron recalibrados.

Para la mecánica de los parámetros, consulta la guía del parámetro de esfuerzo. Para el flujo de trabajo en el editor, consulta usando Opus 5 en Claude Code. Para una visión general del modelo, empieza por qué es Claude Opus 5. La visión general de modelos de Anthropic contiene la tabla de especificaciones actual.

Preguntas frecuentes

¿Debería eliminar “revisa tu trabajo” de mis prompts?

Sí. La guía de prompting de Anthropic indica que Opus 5 ya verifica sin que se lo solicites. Las instrucciones heredadas pueden causar sobreverificación. Elimina la regla global y limita cualquier comprobación explícita a un paso crítico concreto.

¿Por qué Opus 5 es tan verboso incluso con poco esfuerzo?

Porque effort controla el pensamiento, no la longitud visible de la salida. Reducir el esfuerzo recorta tokens de razonamiento, pero las respuestas pueden seguir teniendo una longitud similar. Define un límite de palabras o un formato en el prompt.

¿Cómo evito que Opus 5 genere subagentes?

Indícalo directamente:

Do not spawn subagents. Handle this in this conversation.
Enter fullscreen mode Exit fullscreen mode

Si una parte del trabajo se beneficia del paralelismo, establece un máximo numérico y restringe la delegación a tareas independientes.

¿Por qué veo etiquetas <thinking> en mi salida?

Ese artefacto puede aparecer cuando el pensamiento está deshabilitado. No añadas una instrucción que mencione esas etiquetas, porque puede aumentar la probabilidad de fuga. La solución recomendada es mantener el pensamiento habilitado y usar un nivel de esfuerzo más bajo para controlar el costo.

¿Qué ocurre si una llamada a herramienta vuelve como texto plano?

No se ejecuta ninguna acción. El texto queda en el historial de conversación y los turnos posteriores pueden interpretarlo como una operación completada. Valida los turnos del asistente antes de añadirlos al historial y, cuando sea posible, mantén el pensamiento habilitado.

Top comments (0)