DEV Community

Cover image for ¿Cómo usar la API de GPT-6.1 Sol?
Roobia
Roobia

Posted on Originally published at apidog.com

¿Cómo usar la API de GPT-6.1 Sol?

Para llamar a la API GPT-6.1 Sol, envía una solicitud POST a https://api.openai.com/v1/responses con "model": "gpt-6.1-sol" y tu clave como token Bearer. Conserva el precio de $2 de entrada y $10 de salida por millón de tokens de GPT-6 Sol, mientras que la entrada en caché baja de $0.20 a $0.10. La migración desde gpt-6-sol es principalmente un cambio de ID de modelo, pero hay un cambio incompatible importante: GPT-6.1 Sol no acepta none ni minimal en reasoning.effort. Debes migrar esas solicitudes a low y volver a evaluar cualquier flujo que dependiera de none.

Prueba Apidog hoy

OpenAI lanzó GPT-6.1 Sol en el DevDay el 29 de septiembre de 2026. El resumen del DevDay 2026 cubre los demás lanzamientos, y qué es GPT-6.1 Sol profundiza en los benchmarks. Esta guía muestra cómo enviar tu primera solicitud, elegir un nivel de esfuerzo, migrar desde GPT-6 Sol, calcular precios de Batch, Flex y Fast, y ejecutar una regresión comparativa de ambos IDs de modelo en Apidog antes de mover tráfico de producción.

GPT-6 Sol vs GPT-6.1 Sol: qué cambia en la API

La mayor parte de la especificación es idéntica. Estas son las diferencias entre la página del modelo GPT-6.1 Sol, la página del modelo GPT-6 Sol y la guía de migración de GPT-6 de OpenAI.

gpt-6-sol gpt-6.1-sol Qué hacer
Entrada / salida por 1M (Estándar) $2 / $10 $2 / $10 Nada
Entrada en caché por 1M $0.20 $0.10 Vuelve a calcular el costo de caché
Escrituras en caché por 1M $2.50 $2.50 Nada
Ventana de contexto / entrada máxima / salida máxima 1,050,000 / 922,000 / 128,000 1,050,000 / 922,000 / 128,000 Nada
Fecha de corte del conocimiento 20 de abril de 2026 30 de abril de 2026 Revisa evaluaciones sensibles a la fecha
reasoning.effort none, low, medium (predeterminado), high, xhigh, max low, medium (predeterminado), high, xhigh, max Migra none a low y reevalúa
Llamada a funciones en Chat Completions Solo con reasoning_effort: "none" No compatible Migra llamadas a herramientas a Responses
Endpoints Chat Completions, Responses, Batch Igual Nada
Límites de tarifa Nivel 1: 500 RPM / 500K TPM; Nivel 5: 15,000 RPM / 40M TPM Igual Nada

La página de GPT-6 Sol ahora redirige a los lectores a GPT-6.1 Sol como “el modelo Sol más nuevo”.

Envía tu primera solicitud a GPT-6.1 Sol

Exporta tu clave como OPENAI_API_KEY y llama a la API de Responses:

curl https://api.openai.com/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "List three ways a webhook retry policy can create duplicate orders. One line each."
  }'
Enter fullscreen mode Exit fullscreen mode

El SDK de Python utiliza la misma variable de entorno:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "medium"},
    input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)

print(response.output_text)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Al validar la respuesta, revisa estos campos:

  • status debe ser completed cuando la solicitud termina correctamente. Si el modelo agota el presupuesto de salida, obtendrás incomplete y incomplete_details.reason será max_output_tokens, a veces antes de recibir texto visible. La guía de razonamiento recomienda reservar al menos 25,000 tokens para razonamiento y salida mientras experimentas.
  • output es un array. Localiza el elemento con type: "message" y extrae su contenido output_text. Lee por tipo, no por posición dentro del array.
  • usage.output_tokens incluye los tokens de razonamiento, que se facturan a la tarifa de salida. Usa usage.output_tokens_details.reasoning_tokens para medirlos.
  • usage.input_tokens_details informa cached_tokens y cache_write_tokens. Estos valores permiten verificar el impacto de la caché más barata.

Usa Responses para cualquier flujo con herramientas. GPT-6.1 Sol solo admite Chat Completions para solicitudes sin herramientas. La guía de la API de Responses explica la estructura de solicitud con más detalle.

Elige un nivel de esfuerzo de razonamiento

reasoning.effort es el control principal de costo y calidad. Si lo omites, el valor predeterminado es medium.

La guía de selección de modelos de OpenAI asocia medium con trabajo técnico complejo y entregables coordinados que esperas revisar. Asocia xhigh con entregables pulidos y decisiones basadas en evidencia conflictiva. La publicación de lanzamiento añade resultados por configuración.

Esfuerzo Empieza aquí para Lo que OpenAI informa para GPT-6.1 Sol
low Chat, extracción, clasificación y cualquier flujo que ejecutabas con none En conversaciones marcadas por el usuario, las respuestas con un error factual bajan del 11.4% con GPT-6 Sol al 7.7%
medium Automatizaciones agénticas y flujos de llamada a herramientas AutomationBench 1.0.6: +2.2 pp sobre Claude Opus 5.5 a aproximadamente un tercio del costo; +4.8 pp sobre GPT-6 Sol en la misma configuración
high Depuración compleja y planificación profunda Sin afirmación específica para esta configuración
xhigh Entregables pulidos y ejecuciones asíncronas largas Sin afirmación específica para esta configuración
max Uso de computadora y tareas científicas difíciles OSWorld 2.0: +7 pp sobre GPT-6 Sol al máximo por menos de la mitad del costo. Terminal-Bench Science 0.1: $5.47 por tarea, frente a $23.21 para Opus 5.5 y $23.80 para GPT-6 Astra

Ten en cuenta dos matices:

  1. El conjunto de factualidad contiene conversaciones previamente marcadas por errores; no representa necesariamente tráfico típico.
  2. En Terminal-Bench Science, GPT-6 Astra sigue obteniendo la puntuación más alta (68.1%). OpenAI recomienda Astra para el trabajo científico más difícil.

Para solicitudes sensibles a la latencia que usaban none, empieza con low y mide resultados reales. La guía de razonamiento describe low como razonamiento eficiente con “un modesto aumento de latencia”.

Si necesitas cambiar el esfuerzo a mitad de conversación sin romper la caché de prompts, añade un elemento de entrada configuration_update en lugar de cambiar reasoning.effort a nivel de solicitud.

Migrar desde gpt-6-sol: cuatro cambios en el código

  1. Cambia el ID del modelo. Reemplaza gpt-6-sol por gpt-6.1-sol. Mantén el ID en configuración o en una variable de entorno para que una reversión requiera una sola edición.

  2. Migra none y minimal. La guía de OpenAI indica usar low en lugar de none. Para minimal, empieza también con low y compara resultados en tareas representativas. En GPT-6 Astra, que tampoco admite none, enviarlo devuelve HTTP 400; corrige esta incompatibilidad antes de mover tráfico.

  3. Elimina parámetros de muestreo. Cuando el esfuerzo no sea none, elimina temperature, top_p y top_logprobs; en Chat Completions, elimina también logprobs. El código que combinaba temperature con none en GPT-6 Sol debe cambiar.

  4. Migra herramientas desde Chat Completions a Responses. GPT-6 Sol permitía llamadas a funciones en Chat Completions solo con reasoning_effort: "none". GPT-6.1 Sol no tiene un equivalente para esa combinación.

Después, vuelve a ejecutar cualquier evaluación que dependa de actualidad. La fecha de corte cambia del 20 al 30 de abril de 2026.

Si llegaste a Sol desde Astra, consulta la guía de migración de Astra a Sol.

Precios de Batch, Flex, Fast y entrada en caché

Cada nivel mantiene la estructura de GPT-6 Sol, con la entrada en caché reducida a la mitad. Los precios por 1M de tokens proceden de la página de precios de la API.

La página del modelo indica que un prompt con más de 272K tokens de entrada se factura al doble de las tarifas de entrada y caché, y a 1.5x la tarifa de salida para la solicitud completa.

Nivel Entrada Entrada en caché Escrituras en caché Salida
Estándar $2.00 $0.10 $2.50 $10.00
Por lotes $1.00 $0.05 $1.25 $5.00
Flex $1.00 $0.05 $1.25 $5.00
Rápido $4.00 $0.20 $5.00 $20.00
Estándar, prompt de más de 272K tokens de entrada $4.00 $0.20 $5.00 $15.00

Usa estos valores en la solicitud:

  • Flex: service_tier: "flex"
  • Fast: service_tier: "fast"
  • "priority" también se acepta como alias de Fast.

Fast no está disponible con residencia de datos en la UE. El modo Ultrafast para GPT-6.1 Sol está “próximamente” y actualmente solo está ampliamente disponible para GPT-6 Astra. Consulta el modo Ultrafast de OpenAI.

Para trabajos nocturnos, la guía de la API Batch de OpenAI explica cómo ejecutar solicitudes por lotes.

Calcula el ahorro de caché

La caché es donde esta actualización reduce costos:

  • En GPT-6.1 Sol, las lecturas cuestan 0.05x la tarifa de entrada.
  • En GPT-6 Sol, las lecturas cuestan 0.1x la tarifa de entrada.
  • Las escrituras cuestan 1.25x la tarifa de entrada en ambos modelos.

Según la guía de almacenamiento en caché de prompts, considera un prompt de sistema de 50,000 tokens reutilizado en 1,000 solicitudes:

  • Una escritura cuesta $0.125 en ambos modelos.
  • Las 999 lecturas cuestan $9.99 en GPT-6 Sol.
  • Las 999 lecturas cuestan $5.00 en GPT-6.1 Sol.

El prefijo mínimo cacheable es de 1,024 tokens visibles. Un prefijo en caché sigue siendo elegible durante al menos 30 minutos después de su última escritura o reutilización.

Para definir puntos de corte, consulta almacenamiento en caché de prompts de GPT-6.

Prueba el cambio en Apidog

No migres producción basándote únicamente en precios de lista. Envía la misma solicitud guardada a ambos IDs de modelo y compara resultado, uso y costo.

En Apidog:

  1. Crea un entorno con:

    • OPENAI_API_KEY, almacenada como secreto.
    • MODEL_ID, inicialmente en gpt-6-sol.
    • EFFORT, inicialmente en medium.
  2. Crea y guarda una solicitud POST https://api.openai.com/v1/responses con la cabecera:

   Authorization: Bearer {{OPENAI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Usa este cuerpo:

   {
     "model": "{{MODEL_ID}}",
     "reasoning": {"effort": "{{EFFORT}}"},
     "max_output_tokens": 25000,
     "input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
   }
Enter fullscreen mode Exit fullscreen mode
  1. Añade aserciones para validar:
  • HTTP 200.
  • $.status es igual a completed.
  • $.output[*].type contiene message.
  • $.usage.output_tokens es mayor que 0.
  • $.usage.output_tokens_details.reasoning_tokens existe.
  • La salida cumple la estructura que consume tu aplicación, por ejemplo, JSON válido con las claves esperadas.
  1. Añade un script de post-procesamiento para convertir usage en dólares:
   const u = pm.response.json().usage;
   const d = u.input_tokens_details || {};
   const cached = d.cached_tokens || 0;
   const writes = d.cache_write_tokens || 0;
   const model = pm.environment.get("MODEL_ID");

   const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;

   const cost = (
     (u.input_tokens - cached - writes) * 2 +
     cached * cachedRate +
     writes * 2.5 +
     u.output_tokens * 10
   ) / 1e6;

   console.log(model, "cost per call $", cost.toFixed(5));
Enter fullscreen mode Exit fullscreen mode
  1. Envía la solicitud con MODEL_ID=gpt-6-sol. Después cambia a MODEL_ID=gpt-6.1-sol y vuelve a enviarla.

Compara:

  • reasoning_tokens
  • output_tokens
  • La respuesta generada
  • El costo registrado
  • La validez de las aserciones

Si migras desde none, ejecuta la línea base con none en GPT-6 Sol y el candidato con low en GPT-6.1 Sol.

Después, añade la solicitud y varios prompts reales a un escenario de prueba y ejecuta ambos modelos desde la CLI de Apidog en CI. --env-var sobrescribe una variable para una ejecución, por lo que un único escenario puede cubrir los dos modelos:

npm install -g apidog-cli

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6-sol" -r cli,junit

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Una aserción fallida detiene el trabajo. Los informes JUnit permiten revisar ambas ejecuciones lado a lado.

Para aserciones sobre salidas que varían entre ejecuciones, consulta cómo probar agentes de IA no deterministas.

Preguntas frecuentes

¿GPT-6.1 Sol es más caro que GPT-6 Sol?

No. Ambos cuestan $2 de entrada y $10 de salida por 1M de tokens. La entrada en caché de GPT-6.1 Sol cuesta $0.10 frente a $0.20 en GPT-6 Sol, por lo que las cargas con alto uso de caché son más económicas.

¿Qué hago con reasoning.effort: "none"?

GPT-6.1 Sol no admite none ni minimal. Migra ambos a low, elimina temperature y top_p, y vuelve a ejecutar tus evaluaciones antes de cambiar tráfico.

¿Puedo usar GPT-6.1 Sol con Chat Completions?

Sí, para solicitudes sin herramientas. Las llamadas a herramientas requieren la API de Responses.

¿Existe un nivel gratuito de la API de GPT-6.1 Sol?

No. Las llamadas a la API se facturan por token desde la primera solicitud. ¿Es GPT-6.1 Sol gratuito? cubre las rutas más económicas.

Siguiente paso

Guarda tu primera solicitud y ejecútala en gpt-6-sol con el esfuerzo actual. Luego ejecútala en gpt-6.1-sol y compara usage y salida con un prompt de tu tráfico real.

Descarga Apidog para conservar ambas ejecuciones como aserciones que puedes repetir en CI.

¿Estás considerando Anthropic? Consulta GPT-6.1 Sol vs Claude Sonnet 5.5.

Top comments (0)