GPT-6.1 Sol y Claude Sonnet 5.5 cuestan $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Se lanzaron con un día de diferencia: Sonnet 5.5 el 28 de septiembre de 2026 y GPT-6.1 Sol el 29 de septiembre. Ningún proveedor los ha comparado directamente. OpenAI comparó GPT-6.1 Sol con Claude Opus 5.5 y Fable 5.1; Anthropic comparó Sonnet 5.5 con GPT-6 Sol, el modelo Sol anterior. Para elegir de forma fiable, ejecute ambos con sus propias tareas y mida el costo por tarea aprobada, no solo el precio por token.
Este artículo reúne las especificaciones, precios, afirmaciones de cada proveedor y métricas de terceros disponibles —que todavía comparan Sonnet 5.5 con GPT-6 Sol, no con GPT-6.1 Sol—. También incluye un procedimiento reproducible para probar ambos modelos en Apidog. Para revisar cada modelo por separado, consulte qué es GPT-6.1 Sol y qué es Claude Sonnet 5.5.
GPT-6.1 Sol vs Claude Sonnet 5.5: especificaciones y precios
Fuentes: precios de OpenAI, descripción de Sonnet 5.5, precios de Anthropic y la página del modelo GPT-6.1 Sol.
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| ID del modelo | gpt-6.1-sol |
claude-sonnet-5-5 (Bedrock: anthropic.claude-sonnet-5-5) |
| Lanzamiento | 29 de septiembre de 2026 | 28 de septiembre de 2026 |
| Entrada / salida por 1M | $2 / $10 | $2 / $10 |
| Lecturas de caché por 1M | $0.10 | $0.20 |
| Escrituras de caché por 1M | $2.50 | $2.50 (5 minutos), $4 (1 hora) |
| Lote por 1M | $1 / $5 | $1 / $5 |
| Prompts de más de 272K tokens de entrada | $4 de entrada, $0.20 de caché y $15 de salida para toda la solicitud | Sin prima dentro de la ventana de 1M |
| Nivel más rápido | Fast a $4 / $20; Ultrafast «próximamente» | No disponible |
| Ventana de contexto | 1,050,000; máximo de 922,000 tokens de entrada | 1M |
| Salida máxima | 128,000 | 128K; 300K en Batch con una cabecera beta |
| Corte de conocimiento | 30 de abril de 2026 | Junio de 2026 |
| Niveles de esfuerzo |
low, medium (predeterminado), high, xhigh, max; no none
|
low, medium, high (predeterminado de API), xhigh, max; el pensamiento no se puede desactivar |
| API | Responses con herramientas, Chat Completions sin herramientas, Batch | Messages, Batch |
| Otras plataformas | OpenRouter: openai/gpt-6.1-sol
|
Bedrock, Google Cloud, Microsoft Foundry y Claude Platform en AWS |
| Acceso gratuito | Ninguno. Disponible en planes Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y Codex; sin nivel gratuito de API | Disponible para chatear en Claude.ai; la API se cobra por token |
Las filas que más afectan el costo son las de caché y prompts largos:
- Caché: las lecturas de caché de GPT-6.1 Sol cuestan la mitad que las de Sonnet 5.5. Si reutiliza instrucciones de sistema o contexto largo, OpenAI puede resultar más barato.
- Prompts mayores de 272K tokens: GPT-6.1 Sol aplica tarifas más altas a toda la solicitud. Sonnet 5.5 mantiene $2 por entrada y $10 por salida dentro de su ventana de 1M.
Por ejemplo, sin caché, un prompt de 400,000 tokens con una respuesta de 5,000 tokens cuesta aproximadamente:
- GPT-6.1 Sol: $1.68
- Claude Sonnet 5.5: $0.85
Lo que cada proveedor afirma y contra qué modelo
| OpenAI sobre GPT-6.1 Sol | Anthropic sobre Claude Sonnet 5.5 | |
|---|---|---|
| Comparado con | GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 | Sonnet 5, Opus 5.5, GPT-6 Sol; GPT-5.6 Sol en dos gráficos |
| ¿Incluye el otro modelo? | No | No; GPT-6.1 Sol todavía no existía |
| Titular | «Inteligencia casi-Astra» a una quinta parte del precio estándar de Astra | Más de 30% más rápido que Sonnet 5 y hasta 30% menos costo por tarea |
| Quién calculó los resultados | OpenAI; resultados de competiciones de informes públicos según su nota al pie | Anthropic, Cognition, Cursor, Artificial Analysis y Surge AI según el benchmark |
La publicación de lanzamiento de GPT-6.1 Sol informa:
- AutomationBench 1.0.6, esfuerzo medio: +2.2 puntos porcentuales frente a Opus 5.5 con aproximadamente un tercio del costo; +4.8 pp frente a GPT-6 Sol.
- Terminal-Bench Science 0.1, esfuerzo máximo: $5.47 por tarea frente a $23.21 para Opus 5.5. GPT-6 Astra mantiene la puntuación más alta, con 68.1%.
- OSWorld 2.0 offline, esfuerzo máximo: +7 pp frente a GPT-6 Sol por menos de la mitad del costo.
La publicación de lanzamiento de Sonnet 5.5 incluye resultados frente a GPT-6 Sol:
-
FrontierCode 1.1, ejecutado por Cognition: Sonnet 5.5 alcanza 52.1% en
xhighy 46.2% enmax, frente a 49.3% de GPT-6 Sol. Anthropic afirma que, con esfuerzo alto, Sonnet 5.5 iguala la mejor puntuación de GPT-6 Sol por aproximadamente una quinta parte del costo. - GDPval-AA v2.1 y AA-Briefcase v1.1, ejecutados por Artificial Analysis: 1844 frente a 1487, y 1811 frente a 1483.
El desglose de benchmarks de Sonnet 5.5 cubre el resto de la tabla de Anthropic.
No combine los resultados de ambos proveedores como si fueran una sola comparación. Los arneses y las configuraciones no coinciden:
- OpenAI informa AutomationBench 1.0.6 con esfuerzo medio en su propio arnés.
- Anthropic ejecuta sus modelos Claude con esfuerzo máximo en su tabla de resumen.
- Anthropic informa 59.9% para Sonnet 5.5 en Terminal-Bench Science, mientras que OpenAI no publica una puntuación bruta de GPT-6.1 Sol para esa comparación.
- OpenAI usó OSWorld 2.0 offline; Anthropic usó OSWorld 2.1.
La comparación de GPT-6 Sol vs Claude Opus 5.5 encontró el mismo problema: los benchmarks no son directamente intercambiables.
Lo que midieron terceros: GPT-6 Sol, no GPT-6.1 Sol
Las comparaciones de terceros disponibles emparejan Sonnet 5.5 con GPT-6 Sol. La más completa es la de Artificial Analysis, cuyo Intelligence Index v4.3.2 agrega 10 evaluaciones.
| Esfuerzo | Índice Sonnet 5.5 | Costo por tarea Sonnet 5.5 | Índice GPT-6 Sol | Costo por tarea GPT-6 Sol |
|---|---|---|---|---|
| Medio | 41 | $0.59 | 40 | $0.25 |
| Alto | 47 | $1.08 | 43 | $0.38 |
| Xalto | 52 | $2.74 | 44 | $0.52 |
| Máximo | 56 | $7.60 | 48 | $1.05 |
Con esfuerzo máximo, esa misma página mide:
- Sonnet 5.5: 138 tokens de salida por segundo.
- GPT-6 Sol: 76 tokens de salida por segundo.
Sonnet 5.5 obtiene una puntuación más alta, pero tiene mayor costo por tarea en cada nivel mostrado. Con precios de lista idénticos, la diferencia proviene del consumo efectivo de tokens.
Una equivalencia útil de esos datos es:
- Sonnet 5.5 con esfuerzo
high: índice 47, $1.08 por tarea. - GPT-6 Sol con esfuerzo
max: índice 48, $1.05 por tarea.
Los datos mostrados por Anthropic también varían según el benchmark:
- En AA-Briefcase, GPT-6 Sol cuesta menos por tarea en todos los niveles, aunque Sonnet 5.5 obtiene una puntuación más alta.
- En FrontierCode, Sonnet 5.5 con esfuerzo alto logra 49.4% por $0.42 por tarea, frente a 49.3% de GPT-6 Sol con esfuerzo máximo por $2.07.
Estos resultados corresponden a GPT-6 Sol, no a GPT-6.1 Sol. OpenAI afirma que GPT-6.1 Sol supera a GPT-6 Sol con el mismo o menor esfuerzo en varios benchmarks, pero habrá que esperar mediciones independientes.
Cuándo usar cada modelo
GPT-6.1 Sol
OpenAI lo posiciona para:
- Codificación compleja.
- Automatización de agentes.
- Uso de computadoras.
- Trabajo profesional que requiere rendimiento cercano a Astra a menor costo.
Puede ser una opción especialmente interesante si:
- Reutiliza prompts largos mediante caché.
- Sus entradas suelen quedar por debajo de 272K tokens.
- Necesita el nivel de velocidad de pago Fast.
- Sus tareas se parecen a automatización, uso de computadora o flujos científicos.
Claude Sonnet 5.5
Anthropic lo posiciona para:
- Tareas cotidianas bien definidas.
- Corrección de errores.
- Generación y revisión de documentos.
- Diapositivas y hojas de cálculo.
- Codificación de agentes y trabajo de conocimiento.
Puede encajar mejor si:
- Sus prompts superan con frecuencia los 272K tokens.
- Necesita ejecutarlo en Bedrock, Google Cloud o Microsoft Foundry.
- Sus tareas dependen de rendimiento en trabajo de conocimiento, documentos o uso de computadoras.
- Busca comparar rendimiento de codificación de agentes con distintos niveles de esfuerzo.
Anthropic indica que Opus 5.5 sigue siendo más fuerte para trabajo complejo y abierto. Consulte Sonnet 5.5 vs Opus 5.5 para ese caso.
Cómo comparar ambos modelos en Apidog
No pruebe un único prompt manualmente. Construya un escenario reproducible con 20 a 50 tareas reales y resultados verificables: JSON válido, una etiqueta esperada, una consulta SQL comprobable o una prueba de repositorio.
1. Cree un entorno
En Apidog, cree un entorno con estas variables secretas:
OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
Use también una variable prompt que se cargará desde un CSV.
2. Guarde una solicitud para cada proveedor
Las APIs tienen formatos distintos. Consulte la referencia de Responses, la referencia de Messages y esta comparación de formatos de API.
OpenAI Responses API:
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{
"model": "gpt-6.1-sol",
"reasoning": {
"effort": "{{EFFORT}}"
},
"max_output_tokens": 25000,
"input": "{{prompt}}"
}
Anthropic Messages API:
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{
"model": "claude-sonnet-5-5",
"max_tokens": 25000,
"output_config": {
"effort": "{{EFFORT}}"
},
"messages": [
{
"role": "user",
"content": "{{prompt}}"
}
]
}
3. Agregue aserciones de respuesta y calidad
Además de validar que la respuesta terminó correctamente, compare el resultado con una columna expected de su CSV.
| Comprobación | OpenAI Responses | Anthropic Messages |
|---|---|---|
| Terminó normalmente |
$.status es completed
|
$.stop_reason es end_turn
|
| Hay respuesta |
$.output[*].type contiene message
|
$.content[*].type contiene text
|
| Tokens de salida, incluido razonamiento | $.usage.output_tokens |
$.usage.output_tokens |
| Lecturas de caché | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| Escrituras de caché | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
Para tareas estructuradas, haga que ambos devuelvan un formato que pueda evaluar automáticamente. Por ejemplo:
Devuelve únicamente JSON válido con:
{
"label": "valor esperado",
"confidence": 0
}
Así puede validar $.label contra expected y registrar una tasa de aprobación por modelo y nivel de esfuerzo.
4. Calcule el costo de cada ejecución
Al calcular precios, trate la caché de forma distinta en cada proveedor:
- En OpenAI,
input_tokensincluye tokens normales, de lectura de caché y de escritura de caché. Reste los tokens de caché antes de aplicar la tarifa estándar de entrada. Consulte la guía de caché de prompts de OpenAI. - En Anthropic,
input_tokenscuenta solo los tokens después del último punto de interrupción de caché. Consulte la guía de caché de prompts de Anthropic. - Para GPT-6.1 Sol, aplique la tarifa para prompts de más de 272K tokens de entrada a toda la solicitud.
Registre, como mínimo, estos campos por ejecución:
task_id
model
effort
passed
input_tokens
output_tokens
cache_read_tokens
cache_write_tokens
estimated_cost
latency
La métrica principal debe ser:
costo_por_tarea_aprobada = gasto_total / tareas_aprobadas
5. Ejecute el escenario con la CLI
Guarde los prompts en un CSV de una sola línea por fila y evite comillas dobles dentro del contenido. Ejecute el mismo escenario para cada nivel de esfuerzo:
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Repita al menos para:
EFFORT=medium
EFFORT=high
No asuma que high representa el mismo presupuesto de razonamiento en ambos proveedores. GPT-6.1 Sol usa medium como predeterminado; Sonnet 5.5 usa high como predeterminado de API.
También debe controlar la variabilidad: ninguno de los modelos admite las perillas de muestreo de la misma forma. Sonnet 5.5 devuelve 400 con valores no predeterminados de temperature, top_p o top_k. La guía de modelos GPT-6 recomienda reducir temperature y top_p cuando el esfuerzo no es none. Ejecute varias repeticiones para tareas sensibles.
Para más detalles de implementación, consulte la guía de la API de GPT-6.1 Sol y cómo usar la API de Claude Sonnet 5.5.
Preguntas frecuentes
¿Es GPT-6.1 Sol más barato que Claude Sonnet 5.5?
Tienen el mismo precio de lista: $2 por 1M tokens de entrada y $10 por 1M tokens de salida. GPT-6.1 Sol tiene lecturas de caché más baratas; Sonnet 5.5 evita la prima de GPT-6.1 Sol para entradas superiores a 272K tokens. El costo real depende de los tokens consumidos y de la tasa de aprobación.
¿Cuál es mejor para codificación?
No hay un benchmark compartido entre GPT-6.1 Sol y Sonnet 5.5. Anthropic informa que Sonnet 5.5 supera a GPT-6 Sol en FrontierCode. OpenAI informa que GPT-6.1 Sol supera la mejor puntuación DeepSWE de GPT-6 Sol en 6.4 pp. Pruébelos en su repositorio, con issues y pruebas reales.
¿Cuál es más rápido?
Artificial Analysis midió 138 tokens por segundo para Sonnet 5.5 y 76 para GPT-6 Sol, ambos con esfuerzo máximo. No hay todavía una medición independiente equivalente para GPT-6.1 Sol.
¿Alguno es gratuito?
GPT-6.1 Sol no tiene un nivel gratuito de API. Sonnet 5.5 está disponible en las aplicaciones de chat de Claude.ai, pero la API se cobra por token. Consulte cómo usar Claude Sonnet 5.5 gratis.
Elija ejecutando ambos
Tome diez tareas de su backlog, ejecútelas con ambos modelos en medium y high, y compare:
- Tasa de tareas aprobadas.
- Costo total.
- Costo por tarea aprobada.
- Latencia.
- Consumo de tokens y caché.
Descargue Apidog para guardar ambas solicitudes en un único escenario y repetir la comparación cuando Artificial Analysis publique métricas de GPT-6.1 Sol o cualquiera de los proveedores lance una nueva versión.
Top comments (0)