Para llamar a la API GPT-6.1 Sol, envía una solicitud POST a https://api.openai.com/v1/responses con "model": "gpt-6.1-sol" y tu clave como token Bearer. Conserva el precio de $2 de entrada y $10 de salida por millón de tokens de GPT-6 Sol, mientras que la entrada en caché baja de $0.20 a $0.10. La migración desde gpt-6-sol es principalmente un cambio de ID de modelo, pero hay un cambio incompatible importante: GPT-6.1 Sol no acepta none ni minimal en reasoning.effort. Debes migrar esas solicitudes a low y volver a evaluar cualquier flujo que dependiera de none.
OpenAI lanzó GPT-6.1 Sol en el DevDay el 29 de septiembre de 2026. El resumen del DevDay 2026 cubre los demás lanzamientos, y qué es GPT-6.1 Sol profundiza en los benchmarks. Esta guía muestra cómo enviar tu primera solicitud, elegir un nivel de esfuerzo, migrar desde GPT-6 Sol, calcular precios de Batch, Flex y Fast, y ejecutar una regresión comparativa de ambos IDs de modelo en Apidog antes de mover tráfico de producción.
GPT-6 Sol vs GPT-6.1 Sol: qué cambia en la API
La mayor parte de la especificación es idéntica. Estas son las diferencias entre la página del modelo GPT-6.1 Sol, la página del modelo GPT-6 Sol y la guía de migración de GPT-6 de OpenAI.
gpt-6-sol |
gpt-6.1-sol |
Qué hacer | |
|---|---|---|---|
| Entrada / salida por 1M (Estándar) | $2 / $10 | $2 / $10 | Nada |
| Entrada en caché por 1M | $0.20 | $0.10 | Vuelve a calcular el costo de caché |
| Escrituras en caché por 1M | $2.50 | $2.50 | Nada |
| Ventana de contexto / entrada máxima / salida máxima | 1,050,000 / 922,000 / 128,000 | 1,050,000 / 922,000 / 128,000 | Nada |
| Fecha de corte del conocimiento | 20 de abril de 2026 | 30 de abril de 2026 | Revisa evaluaciones sensibles a la fecha |
reasoning.effort |
none, low, medium (predeterminado), high, xhigh, max
|
low, medium (predeterminado), high, xhigh, max
|
Migra none a low y reevalúa |
| Llamada a funciones en Chat Completions | Solo con reasoning_effort: "none"
|
No compatible | Migra llamadas a herramientas a Responses |
| Endpoints | Chat Completions, Responses, Batch | Igual | Nada |
| Límites de tarifa | Nivel 1: 500 RPM / 500K TPM; Nivel 5: 15,000 RPM / 40M TPM | Igual | Nada |
La página de GPT-6 Sol ahora redirige a los lectores a GPT-6.1 Sol como “el modelo Sol más nuevo”.
Envía tu primera solicitud a GPT-6.1 Sol
Exporta tu clave como OPENAI_API_KEY y llama a la API de Responses:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
El SDK de Python utiliza la misma variable de entorno:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
Al validar la respuesta, revisa estos campos:
-
statusdebe sercompletedcuando la solicitud termina correctamente. Si el modelo agota el presupuesto de salida, obtendrásincompleteyincomplete_details.reasonserámax_output_tokens, a veces antes de recibir texto visible. La guía de razonamiento recomienda reservar al menos 25,000 tokens para razonamiento y salida mientras experimentas. -
outputes un array. Localiza el elemento contype: "message"y extrae su contenidooutput_text. Lee por tipo, no por posición dentro del array. -
usage.output_tokensincluye los tokens de razonamiento, que se facturan a la tarifa de salida. Usausage.output_tokens_details.reasoning_tokenspara medirlos. -
usage.input_tokens_detailsinformacached_tokensycache_write_tokens. Estos valores permiten verificar el impacto de la caché más barata.
Usa Responses para cualquier flujo con herramientas. GPT-6.1 Sol solo admite Chat Completions para solicitudes sin herramientas. La guía de la API de Responses explica la estructura de solicitud con más detalle.
Elige un nivel de esfuerzo de razonamiento
reasoning.effort es el control principal de costo y calidad. Si lo omites, el valor predeterminado es medium.
La guía de selección de modelos de OpenAI asocia medium con trabajo técnico complejo y entregables coordinados que esperas revisar. Asocia xhigh con entregables pulidos y decisiones basadas en evidencia conflictiva. La publicación de lanzamiento añade resultados por configuración.
| Esfuerzo | Empieza aquí para | Lo que OpenAI informa para GPT-6.1 Sol |
|---|---|---|
low |
Chat, extracción, clasificación y cualquier flujo que ejecutabas con none
|
En conversaciones marcadas por el usuario, las respuestas con un error factual bajan del 11.4% con GPT-6 Sol al 7.7% |
medium |
Automatizaciones agénticas y flujos de llamada a herramientas | AutomationBench 1.0.6: +2.2 pp sobre Claude Opus 5.5 a aproximadamente un tercio del costo; +4.8 pp sobre GPT-6 Sol en la misma configuración |
high |
Depuración compleja y planificación profunda | Sin afirmación específica para esta configuración |
xhigh |
Entregables pulidos y ejecuciones asíncronas largas | Sin afirmación específica para esta configuración |
max |
Uso de computadora y tareas científicas difíciles | OSWorld 2.0: +7 pp sobre GPT-6 Sol al máximo por menos de la mitad del costo. Terminal-Bench Science 0.1: $5.47 por tarea, frente a $23.21 para Opus 5.5 y $23.80 para GPT-6 Astra |
Ten en cuenta dos matices:
- El conjunto de factualidad contiene conversaciones previamente marcadas por errores; no representa necesariamente tráfico típico.
- En Terminal-Bench Science, GPT-6 Astra sigue obteniendo la puntuación más alta (68.1%). OpenAI recomienda Astra para el trabajo científico más difícil.
Para solicitudes sensibles a la latencia que usaban none, empieza con low y mide resultados reales. La guía de razonamiento describe low como razonamiento eficiente con “un modesto aumento de latencia”.
Si necesitas cambiar el esfuerzo a mitad de conversación sin romper la caché de prompts, añade un elemento de entrada configuration_update en lugar de cambiar reasoning.effort a nivel de solicitud.
Migrar desde gpt-6-sol: cuatro cambios en el código
Cambia el ID del modelo. Reemplaza
gpt-6-solporgpt-6.1-sol. Mantén el ID en configuración o en una variable de entorno para que una reversión requiera una sola edición.Migra
noneyminimal. La guía de OpenAI indica usarlowen lugar denone. Paraminimal, empieza también conlowy compara resultados en tareas representativas. En GPT-6 Astra, que tampoco admitenone, enviarlo devuelve HTTP 400; corrige esta incompatibilidad antes de mover tráfico.Elimina parámetros de muestreo. Cuando el esfuerzo no sea
none, eliminatemperature,top_pytop_logprobs; en Chat Completions, elimina tambiénlogprobs. El código que combinabatemperatureconnoneen GPT-6 Sol debe cambiar.Migra herramientas desde Chat Completions a Responses. GPT-6 Sol permitía llamadas a funciones en Chat Completions solo con
reasoning_effort: "none". GPT-6.1 Sol no tiene un equivalente para esa combinación.
Después, vuelve a ejecutar cualquier evaluación que dependa de actualidad. La fecha de corte cambia del 20 al 30 de abril de 2026.
Si llegaste a Sol desde Astra, consulta la guía de migración de Astra a Sol.
Precios de Batch, Flex, Fast y entrada en caché
Cada nivel mantiene la estructura de GPT-6 Sol, con la entrada en caché reducida a la mitad. Los precios por 1M de tokens proceden de la página de precios de la API.
La página del modelo indica que un prompt con más de 272K tokens de entrada se factura al doble de las tarifas de entrada y caché, y a 1.5x la tarifa de salida para la solicitud completa.
| Nivel | Entrada | Entrada en caché | Escrituras en caché | Salida |
|---|---|---|---|---|
| Estándar | $2.00 | $0.10 | $2.50 | $10.00 |
| Por lotes | $1.00 | $0.05 | $1.25 | $5.00 |
| Flex | $1.00 | $0.05 | $1.25 | $5.00 |
| Rápido | $4.00 | $0.20 | $5.00 | $20.00 |
| Estándar, prompt de más de 272K tokens de entrada | $4.00 | $0.20 | $5.00 | $15.00 |
Usa estos valores en la solicitud:
- Flex:
service_tier: "flex" - Fast:
service_tier: "fast" -
"priority"también se acepta como alias de Fast.
Fast no está disponible con residencia de datos en la UE. El modo Ultrafast para GPT-6.1 Sol está “próximamente” y actualmente solo está ampliamente disponible para GPT-6 Astra. Consulta el modo Ultrafast de OpenAI.
Para trabajos nocturnos, la guía de la API Batch de OpenAI explica cómo ejecutar solicitudes por lotes.
Calcula el ahorro de caché
La caché es donde esta actualización reduce costos:
- En GPT-6.1 Sol, las lecturas cuestan
0.05xla tarifa de entrada. - En GPT-6 Sol, las lecturas cuestan
0.1xla tarifa de entrada. - Las escrituras cuestan
1.25xla tarifa de entrada en ambos modelos.
Según la guía de almacenamiento en caché de prompts, considera un prompt de sistema de 50,000 tokens reutilizado en 1,000 solicitudes:
- Una escritura cuesta
$0.125en ambos modelos. - Las 999 lecturas cuestan
$9.99en GPT-6 Sol. - Las 999 lecturas cuestan
$5.00en GPT-6.1 Sol.
El prefijo mínimo cacheable es de 1,024 tokens visibles. Un prefijo en caché sigue siendo elegible durante al menos 30 minutos después de su última escritura o reutilización.
Para definir puntos de corte, consulta almacenamiento en caché de prompts de GPT-6.
Prueba el cambio en Apidog
No migres producción basándote únicamente en precios de lista. Envía la misma solicitud guardada a ambos IDs de modelo y compara resultado, uso y costo.
En Apidog:
-
Crea un entorno con:
-
OPENAI_API_KEY, almacenada como secreto. -
MODEL_ID, inicialmente engpt-6-sol. -
EFFORT, inicialmente enmedium.
-
Crea y guarda una solicitud
POST https://api.openai.com/v1/responsescon la cabecera:
Authorization: Bearer {{OPENAI_API_KEY}}
Usa este cuerpo:
{
"model": "{{MODEL_ID}}",
"reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- Añade aserciones para validar:
- HTTP 200.
-
$.statuses igual acompleted. -
$.output[*].typecontienemessage. -
$.usage.output_tokenses mayor que0. -
$.usage.output_tokens_details.reasoning_tokensexiste. - La salida cumple la estructura que consume tu aplicación, por ejemplo, JSON válido con las claves esperadas.
- Añade un script de post-procesamiento para convertir
usageen dólares:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = (
(u.input_tokens - cached - writes) * 2 +
cached * cachedRate +
writes * 2.5 +
u.output_tokens * 10
) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- Envía la solicitud con
MODEL_ID=gpt-6-sol. Después cambia aMODEL_ID=gpt-6.1-soly vuelve a enviarla.
Compara:
reasoning_tokensoutput_tokens- La respuesta generada
- El costo registrado
- La validez de las aserciones
Si migras desde none, ejecuta la línea base con none en GPT-6 Sol y el candidato con low en GPT-6.1 Sol.
Después, añade la solicitud y varios prompts reales a un escenario de prueba y ejecuta ambos modelos desde la CLI de Apidog en CI. --env-var sobrescribe una variable para una ejecución, por lo que un único escenario puede cubrir los dos modelos:
npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Una aserción fallida detiene el trabajo. Los informes JUnit permiten revisar ambas ejecuciones lado a lado.
Para aserciones sobre salidas que varían entre ejecuciones, consulta cómo probar agentes de IA no deterministas.
Preguntas frecuentes
¿GPT-6.1 Sol es más caro que GPT-6 Sol?
No. Ambos cuestan $2 de entrada y $10 de salida por 1M de tokens. La entrada en caché de GPT-6.1 Sol cuesta $0.10 frente a $0.20 en GPT-6 Sol, por lo que las cargas con alto uso de caché son más económicas.
¿Qué hago con reasoning.effort: "none"?
GPT-6.1 Sol no admite none ni minimal. Migra ambos a low, elimina temperature y top_p, y vuelve a ejecutar tus evaluaciones antes de cambiar tráfico.
¿Puedo usar GPT-6.1 Sol con Chat Completions?
Sí, para solicitudes sin herramientas. Las llamadas a herramientas requieren la API de Responses.
¿Existe un nivel gratuito de la API de GPT-6.1 Sol?
No. Las llamadas a la API se facturan por token desde la primera solicitud. ¿Es GPT-6.1 Sol gratuito? cubre las rutas más económicas.
Siguiente paso
Guarda tu primera solicitud y ejecútala en gpt-6-sol con el esfuerzo actual. Luego ejecútala en gpt-6.1-sol y compara usage y salida con un prompt de tu tráfico real.
Descarga Apidog para conservar ambas ejecuciones como aserciones que puedes repetir en CI.
¿Estás considerando Anthropic? Consulta GPT-6.1 Sol vs Claude Sonnet 5.5.
Top comments (0)