DEV Community

Cover image for GPT-6.1 Sol vs Claude Sonnet 5.5: mismo precio $2/$10, lanzados un día después, sin benchmark compartido
Roobia
Roobia

Posted on Originally published at apidog.com

GPT-6.1 Sol vs Claude Sonnet 5.5: mismo precio $2/$10, lanzados un día después, sin benchmark compartido

GPT-6.1 Sol y Claude Sonnet 5.5 cuestan $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Se lanzaron con un día de diferencia: Sonnet 5.5 el 28 de septiembre de 2026 y GPT-6.1 Sol el 29 de septiembre. Ningún proveedor los ha comparado directamente. OpenAI comparó GPT-6.1 Sol con Claude Opus 5.5 y Fable 5.1; Anthropic comparó Sonnet 5.5 con GPT-6 Sol, el modelo Sol anterior. Para elegir de forma fiable, ejecute ambos con sus propias tareas y mida el costo por tarea aprobada, no solo el precio por token.

Prueba Apidog hoy

Este artículo reúne las especificaciones, precios, afirmaciones de cada proveedor y métricas de terceros disponibles —que todavía comparan Sonnet 5.5 con GPT-6 Sol, no con GPT-6.1 Sol—. También incluye un procedimiento reproducible para probar ambos modelos en Apidog. Para revisar cada modelo por separado, consulte qué es GPT-6.1 Sol y qué es Claude Sonnet 5.5.

GPT-6.1 Sol vs Claude Sonnet 5.5: especificaciones y precios

Fuentes: precios de OpenAI, descripción de Sonnet 5.5, precios de Anthropic y la página del modelo GPT-6.1 Sol.

GPT-6.1 Sol Claude Sonnet 5.5
ID del modelo gpt-6.1-sol claude-sonnet-5-5 (Bedrock: anthropic.claude-sonnet-5-5)
Lanzamiento 29 de septiembre de 2026 28 de septiembre de 2026
Entrada / salida por 1M $2 / $10 $2 / $10
Lecturas de caché por 1M $0.10 $0.20
Escrituras de caché por 1M $2.50 $2.50 (5 minutos), $4 (1 hora)
Lote por 1M $1 / $5 $1 / $5
Prompts de más de 272K tokens de entrada $4 de entrada, $0.20 de caché y $15 de salida para toda la solicitud Sin prima dentro de la ventana de 1M
Nivel más rápido Fast a $4 / $20; Ultrafast «próximamente» No disponible
Ventana de contexto 1,050,000; máximo de 922,000 tokens de entrada 1M
Salida máxima 128,000 128K; 300K en Batch con una cabecera beta
Corte de conocimiento 30 de abril de 2026 Junio de 2026
Niveles de esfuerzo low, medium (predeterminado), high, xhigh, max; no none low, medium, high (predeterminado de API), xhigh, max; el pensamiento no se puede desactivar
API Responses con herramientas, Chat Completions sin herramientas, Batch Messages, Batch
Otras plataformas OpenRouter: openai/gpt-6.1-sol Bedrock, Google Cloud, Microsoft Foundry y Claude Platform en AWS
Acceso gratuito Ninguno. Disponible en planes Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y Codex; sin nivel gratuito de API Disponible para chatear en Claude.ai; la API se cobra por token

Las filas que más afectan el costo son las de caché y prompts largos:

  • Caché: las lecturas de caché de GPT-6.1 Sol cuestan la mitad que las de Sonnet 5.5. Si reutiliza instrucciones de sistema o contexto largo, OpenAI puede resultar más barato.
  • Prompts mayores de 272K tokens: GPT-6.1 Sol aplica tarifas más altas a toda la solicitud. Sonnet 5.5 mantiene $2 por entrada y $10 por salida dentro de su ventana de 1M.

Por ejemplo, sin caché, un prompt de 400,000 tokens con una respuesta de 5,000 tokens cuesta aproximadamente:

  • GPT-6.1 Sol: $1.68
  • Claude Sonnet 5.5: $0.85

Lo que cada proveedor afirma y contra qué modelo

OpenAI sobre GPT-6.1 Sol Anthropic sobre Claude Sonnet 5.5
Comparado con GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 Sonnet 5, Opus 5.5, GPT-6 Sol; GPT-5.6 Sol en dos gráficos
¿Incluye el otro modelo? No No; GPT-6.1 Sol todavía no existía
Titular «Inteligencia casi-Astra» a una quinta parte del precio estándar de Astra Más de 30% más rápido que Sonnet 5 y hasta 30% menos costo por tarea
Quién calculó los resultados OpenAI; resultados de competiciones de informes públicos según su nota al pie Anthropic, Cognition, Cursor, Artificial Analysis y Surge AI según el benchmark

La publicación de lanzamiento de GPT-6.1 Sol informa:

  • AutomationBench 1.0.6, esfuerzo medio: +2.2 puntos porcentuales frente a Opus 5.5 con aproximadamente un tercio del costo; +4.8 pp frente a GPT-6 Sol.
  • Terminal-Bench Science 0.1, esfuerzo máximo: $5.47 por tarea frente a $23.21 para Opus 5.5. GPT-6 Astra mantiene la puntuación más alta, con 68.1%.
  • OSWorld 2.0 offline, esfuerzo máximo: +7 pp frente a GPT-6 Sol por menos de la mitad del costo.

La publicación de lanzamiento de Sonnet 5.5 incluye resultados frente a GPT-6 Sol:

  • FrontierCode 1.1, ejecutado por Cognition: Sonnet 5.5 alcanza 52.1% en xhigh y 46.2% en max, frente a 49.3% de GPT-6 Sol. Anthropic afirma que, con esfuerzo alto, Sonnet 5.5 iguala la mejor puntuación de GPT-6 Sol por aproximadamente una quinta parte del costo.
  • GDPval-AA v2.1 y AA-Briefcase v1.1, ejecutados por Artificial Analysis: 1844 frente a 1487, y 1811 frente a 1483.

El desglose de benchmarks de Sonnet 5.5 cubre el resto de la tabla de Anthropic.

No combine los resultados de ambos proveedores como si fueran una sola comparación. Los arneses y las configuraciones no coinciden:

  • OpenAI informa AutomationBench 1.0.6 con esfuerzo medio en su propio arnés.
  • Anthropic ejecuta sus modelos Claude con esfuerzo máximo en su tabla de resumen.
  • Anthropic informa 59.9% para Sonnet 5.5 en Terminal-Bench Science, mientras que OpenAI no publica una puntuación bruta de GPT-6.1 Sol para esa comparación.
  • OpenAI usó OSWorld 2.0 offline; Anthropic usó OSWorld 2.1.

La comparación de GPT-6 Sol vs Claude Opus 5.5 encontró el mismo problema: los benchmarks no son directamente intercambiables.

Lo que midieron terceros: GPT-6 Sol, no GPT-6.1 Sol

Las comparaciones de terceros disponibles emparejan Sonnet 5.5 con GPT-6 Sol. La más completa es la de Artificial Analysis, cuyo Intelligence Index v4.3.2 agrega 10 evaluaciones.

Esfuerzo Índice Sonnet 5.5 Costo por tarea Sonnet 5.5 Índice GPT-6 Sol Costo por tarea GPT-6 Sol
Medio 41 $0.59 40 $0.25
Alto 47 $1.08 43 $0.38
Xalto 52 $2.74 44 $0.52
Máximo 56 $7.60 48 $1.05

Con esfuerzo máximo, esa misma página mide:

  • Sonnet 5.5: 138 tokens de salida por segundo.
  • GPT-6 Sol: 76 tokens de salida por segundo.

Sonnet 5.5 obtiene una puntuación más alta, pero tiene mayor costo por tarea en cada nivel mostrado. Con precios de lista idénticos, la diferencia proviene del consumo efectivo de tokens.

Una equivalencia útil de esos datos es:

  • Sonnet 5.5 con esfuerzo high: índice 47, $1.08 por tarea.
  • GPT-6 Sol con esfuerzo max: índice 48, $1.05 por tarea.

Los datos mostrados por Anthropic también varían según el benchmark:

  • En AA-Briefcase, GPT-6 Sol cuesta menos por tarea en todos los niveles, aunque Sonnet 5.5 obtiene una puntuación más alta.
  • En FrontierCode, Sonnet 5.5 con esfuerzo alto logra 49.4% por $0.42 por tarea, frente a 49.3% de GPT-6 Sol con esfuerzo máximo por $2.07.

Estos resultados corresponden a GPT-6 Sol, no a GPT-6.1 Sol. OpenAI afirma que GPT-6.1 Sol supera a GPT-6 Sol con el mismo o menor esfuerzo en varios benchmarks, pero habrá que esperar mediciones independientes.

Cuándo usar cada modelo

GPT-6.1 Sol

OpenAI lo posiciona para:

  • Codificación compleja.
  • Automatización de agentes.
  • Uso de computadoras.
  • Trabajo profesional que requiere rendimiento cercano a Astra a menor costo.

Puede ser una opción especialmente interesante si:

  1. Reutiliza prompts largos mediante caché.
  2. Sus entradas suelen quedar por debajo de 272K tokens.
  3. Necesita el nivel de velocidad de pago Fast.
  4. Sus tareas se parecen a automatización, uso de computadora o flujos científicos.

Claude Sonnet 5.5

Anthropic lo posiciona para:

  • Tareas cotidianas bien definidas.
  • Corrección de errores.
  • Generación y revisión de documentos.
  • Diapositivas y hojas de cálculo.
  • Codificación de agentes y trabajo de conocimiento.

Puede encajar mejor si:

  1. Sus prompts superan con frecuencia los 272K tokens.
  2. Necesita ejecutarlo en Bedrock, Google Cloud o Microsoft Foundry.
  3. Sus tareas dependen de rendimiento en trabajo de conocimiento, documentos o uso de computadoras.
  4. Busca comparar rendimiento de codificación de agentes con distintos niveles de esfuerzo.

Anthropic indica que Opus 5.5 sigue siendo más fuerte para trabajo complejo y abierto. Consulte Sonnet 5.5 vs Opus 5.5 para ese caso.

Cómo comparar ambos modelos en Apidog

No pruebe un único prompt manualmente. Construya un escenario reproducible con 20 a 50 tareas reales y resultados verificables: JSON válido, una etiqueta esperada, una consulta SQL comprobable o una prueba de repositorio.

1. Cree un entorno

En Apidog, cree un entorno con estas variables secretas:

OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
Enter fullscreen mode Exit fullscreen mode

Use también una variable prompt que se cargará desde un CSV.

2. Guarde una solicitud para cada proveedor

Las APIs tienen formatos distintos. Consulte la referencia de Responses, la referencia de Messages y esta comparación de formatos de API.

OpenAI Responses API:

POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{
  "model": "gpt-6.1-sol",
  "reasoning": {
    "effort": "{{EFFORT}}"
  },
  "max_output_tokens": 25000,
  "input": "{{prompt}}"
}
Enter fullscreen mode Exit fullscreen mode

Anthropic Messages API:

POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 25000,
  "output_config": {
    "effort": "{{EFFORT}}"
  },
  "messages": [
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

3. Agregue aserciones de respuesta y calidad

Además de validar que la respuesta terminó correctamente, compare el resultado con una columna expected de su CSV.

Comprobación OpenAI Responses Anthropic Messages
Terminó normalmente $.status es completed $.stop_reason es end_turn
Hay respuesta $.output[*].type contiene message $.content[*].type contiene text
Tokens de salida, incluido razonamiento $.usage.output_tokens $.usage.output_tokens
Lecturas de caché $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
Escrituras de caché $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens

Para tareas estructuradas, haga que ambos devuelvan un formato que pueda evaluar automáticamente. Por ejemplo:

Devuelve únicamente JSON válido con:
{
  "label": "valor esperado",
  "confidence": 0
}
Enter fullscreen mode Exit fullscreen mode

Así puede validar $.label contra expected y registrar una tasa de aprobación por modelo y nivel de esfuerzo.

4. Calcule el costo de cada ejecución

Al calcular precios, trate la caché de forma distinta en cada proveedor:

  • En OpenAI, input_tokens incluye tokens normales, de lectura de caché y de escritura de caché. Reste los tokens de caché antes de aplicar la tarifa estándar de entrada. Consulte la guía de caché de prompts de OpenAI.
  • En Anthropic, input_tokens cuenta solo los tokens después del último punto de interrupción de caché. Consulte la guía de caché de prompts de Anthropic.
  • Para GPT-6.1 Sol, aplique la tarifa para prompts de más de 272K tokens de entrada a toda la solicitud.

Registre, como mínimo, estos campos por ejecución:

task_id
model
effort
passed
input_tokens
output_tokens
cache_read_tokens
cache_write_tokens
estimated_cost
latency
Enter fullscreen mode Exit fullscreen mode

La métrica principal debe ser:

costo_por_tarea_aprobada = gasto_total / tareas_aprobadas
Enter fullscreen mode Exit fullscreen mode

5. Ejecute el escenario con la CLI

Guarde los prompts en un CSV de una sola línea por fila y evite comillas dobles dentro del contenido. Ejecute el mismo escenario para cada nivel de esfuerzo:

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Repita al menos para:

EFFORT=medium
EFFORT=high
Enter fullscreen mode Exit fullscreen mode

No asuma que high representa el mismo presupuesto de razonamiento en ambos proveedores. GPT-6.1 Sol usa medium como predeterminado; Sonnet 5.5 usa high como predeterminado de API.

También debe controlar la variabilidad: ninguno de los modelos admite las perillas de muestreo de la misma forma. Sonnet 5.5 devuelve 400 con valores no predeterminados de temperature, top_p o top_k. La guía de modelos GPT-6 recomienda reducir temperature y top_p cuando el esfuerzo no es none. Ejecute varias repeticiones para tareas sensibles.

Para más detalles de implementación, consulte la guía de la API de GPT-6.1 Sol y cómo usar la API de Claude Sonnet 5.5.

Preguntas frecuentes

¿Es GPT-6.1 Sol más barato que Claude Sonnet 5.5?

Tienen el mismo precio de lista: $2 por 1M tokens de entrada y $10 por 1M tokens de salida. GPT-6.1 Sol tiene lecturas de caché más baratas; Sonnet 5.5 evita la prima de GPT-6.1 Sol para entradas superiores a 272K tokens. El costo real depende de los tokens consumidos y de la tasa de aprobación.

¿Cuál es mejor para codificación?

No hay un benchmark compartido entre GPT-6.1 Sol y Sonnet 5.5. Anthropic informa que Sonnet 5.5 supera a GPT-6 Sol en FrontierCode. OpenAI informa que GPT-6.1 Sol supera la mejor puntuación DeepSWE de GPT-6 Sol en 6.4 pp. Pruébelos en su repositorio, con issues y pruebas reales.

¿Cuál es más rápido?

Artificial Analysis midió 138 tokens por segundo para Sonnet 5.5 y 76 para GPT-6 Sol, ambos con esfuerzo máximo. No hay todavía una medición independiente equivalente para GPT-6.1 Sol.

¿Alguno es gratuito?

GPT-6.1 Sol no tiene un nivel gratuito de API. Sonnet 5.5 está disponible en las aplicaciones de chat de Claude.ai, pero la API se cobra por token. Consulte cómo usar Claude Sonnet 5.5 gratis.

Elija ejecutando ambos

Tome diez tareas de su backlog, ejecútelas con ambos modelos en medium y high, y compare:

  1. Tasa de tareas aprobadas.
  2. Costo total.
  3. Costo por tarea aprobada.
  4. Latencia.
  5. Consumo de tokens y caché.

Descargue Apidog para guardar ambas solicitudes en un único escenario y repetir la comparación cuando Artificial Analysis publique métricas de GPT-6.1 Sol o cualquiera de los proveedores lance una nueva versión.

Top comments (0)