OpenAI redujo los precios de la API de dos de sus tres modelos GPT-5.6 el 30 de julio de 2026. GPT-5.6 Luna ahora cuesta un 80% menos: $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida. GPT-5.6 Terra bajó un 20%, hasta $2 de entrada y $12 de salida. GPT-5.6 Sol, el modelo insignia de razonamiento, mantiene sus tarifas de $5 y $30, pero incorpora un modo Rápido que genera tokens 2.5 veces más rápido por el doble de la tarifa estándar.
Si construyó su modelo de costos con los precios de lanzamiento de GPT-5.6, actualícelo esta semana. Esta guía resume las nuevas tarifas, explica cómo afectan al enrutamiento de modelos y propone un flujo de prueba para comparar costo, latencia y calidad con su tráfico real. Para ejecutar la misma instrucción contra Sol, Terra y Luna, puede usar Apidog y revisar el consumo de tokens antes de cambiar producción.
La nueva tabla de tarifas de GPT-5.6
Precios por millón de tokens:
| Modelo | Entrada anterior | Nueva entrada | Salida anterior | Nueva salida | Cambio |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $5.00 | $30.00 | $30.00 | Sin cambios |
| GPT-5.6 Terra | $2.50 | $2.00 | $15.00 | $12.00 | -20% |
| GPT-5.6 Luna | $1.00 | $0.20 | $6.00 | $1.20 | -80% |
Los nuevos precios entraron en vigor el 30 de julio de 2026 para el nivel estándar de la API. La diferencia entre el extremo superior e inferior de la familia pasó de 5x durante la disponibilidad general del 9 de julio a 25x.
Eso cambia el criterio de enrutamiento:
- Antes, enviar una tarea a Luna en lugar de Sol reducía la factura aproximadamente un 80%.
- Ahora, el ahorro puede llegar al 96% según la mezcla de tokens de entrada y salida.
- Terra sigue siendo una opción intermedia, pero Luna merece una nueva evaluación para tareas de alto volumen.
Los descuentos de caché de instrucciones siguen aplicándose además de estas tarifas. OpenAI no publicó precios separados de entrada en caché para las nuevas tarifas de Luna y Terra en el anuncio; antes de modificar previsiones que dependan de caché, consulte la página oficial de precios.
Qué pasó con Sol
El precio estándar de Sol no cambió, pero sí sus opciones de latencia. OpenAI introdujo un modo Rápido para Sol:
- Velocidad: 2.5 veces más rápida en generación de tokens.
- Costo: el doble de la tarifa estándar.
- Migración: reemplaza el nivel anterior de Procesamiento Prioritario.
Si usa Procesamiento Prioritario en producción, revise su configuración y su facturación. El cambio no consiste en seleccionar un modelo más barato, sino en elegir explícitamente entre costo y latencia para el mismo nivel de razonamiento.
La decisión práctica es simple:
- Use Sol estándar cuando necesite razonamiento de primera línea sin prioridad de latencia.
- Use Sol Rápido solo cuando la latencia interactiva justifique pagar el doble.
- Evalúe Terra y Luna para el resto de las cargas de trabajo.
Por qué OpenAI redujo los precios
OpenAI atribuye los recortes a mejoras de eficiencia en su infraestructura de inferencia:
- Mejor enrutamiento de hardware en su flota de inferencia.
- Mejor software de inferencia para producción.
- Algoritmos de caché de contexto más eficientes.
- Kernels de producción reescritos por GPT-5.6 Sol.
Según el anuncio, Sol reescribió autónomamente kernels de servicio, reduciendo la sobrecarga de extremo a extremo en un 20% y mejorando la eficiencia de generación de tokens en más de un 15%.
También hay presión competitiva. La cobertura de VentureBeat presenta el recorte como una respuesta al nivel Flash de Google. El precio combinado de lista de Luna —$0.20 de entrada más $1.20 de salida— es $1.40 por millón de tokens, por debajo de Gemini 3.5 Flash-Lite a $2.80 y de Gemini 3.6 Flash a $9.
Qué cambia para sus cargas de trabajo
El recorte del 80% de Luna es el cambio que más puede afectar su arquitectura.
Bucles de agentes
Las cargas agentivas consumen tokens en ciclos de planificación, llamadas a herramientas, lectura de resultados y reintentos. Con el nuevo precio de Luna, este tipo de flujo pasa a ser un candidato claro para el nivel económico.
Antes de cambiar, mida especialmente:
- Número de iteraciones por tarea.
- Tokens de salida generados en cada iteración.
- Tasa de reintentos.
- Calidad final frente a Terra o Sol.
Clasificación, extracción y resúmenes
Si mantiene clasificación, extracción estructurada o resúmenes en Terra por seguridad, vuelva a ejecutar su evaluación. La calidad del modelo no cambió, pero sí el costo de operar Luna.
Como referencia, una carga que costaba $100 diarios en Terra podría costar alrededor de $11 diarios en Luna con las nuevas tarifas, dependiendo de la proporción entre tokens de entrada y salida.
Terra como valor predeterminado
Nuestro desglose de Sol vs Terra vs Luna recomendó Terra como un valor predeterminado razonable para trabajo diario. Esa recomendación sigue siendo válida y ahora cuesta un 20% menos.
El nivel de esfuerzo sigue importando
GPT-5.6 expone seis niveles de esfuerzo de razonamiento. Un esfuerzo mayor genera más tokens de salida, que siguen siendo la parte más costosa de la factura en todos los niveles.
No use el recorte de precios como sustituto de una configuración correcta de esfuerzo. Mida primero si su tarea realmente necesita el nivel de razonamiento configurado.
Cómo volver a calcular sus costos
No calcule solo con porcentajes de lista. Use solicitudes reales de producción y compare los tres modelos con el mismo conjunto de evaluación.
1. Extraiga una muestra representativa
Incluya solicitudes de los flujos que más consumen:
- Consultas largas con mucho contexto.
- Resúmenes con salida extensa.
- Clasificación en lote.
- Flujos agentivos con herramientas.
- Casos complejos que actualmente requieren Sol.
2. Haga que el modelo sea configurable
Evite fijar el ID del modelo en el código. Cárguelo desde una variable de entorno:
const model = process.env.OPENAI_MODEL ?? "gpt-5.6-terra";
const response = await client.responses.create({
model,
input: "Resume este documento y devuelve tres acciones concretas."
});
console.log(response.usage);
Luego ejecute la misma prueba con cada modelo:
OPENAI_MODEL=gpt-5.6-luna node benchmark.js
OPENAI_MODEL=gpt-5.6-terra node benchmark.js
OPENAI_MODEL=gpt-5.6-sol node benchmark.js
3. Calcule el costo con los tokens devueltos
Use los valores de usage de cada respuesta:
function calcularCosto({ inputTokens, outputTokens, inputRate, outputRate }) {
return (
(inputTokens / 1_000_000) * inputRate +
(outputTokens / 1_000_000) * outputRate
);
}
const costoLuna = calcularCosto({
inputTokens: 12_000,
outputTokens: 2_000,
inputRate: 0.20,
outputRate: 1.20
});
console.log(`Costo estimado: $${costoLuna.toFixed(6)}`);
4. Compare calidad, latencia y costo
No cambie de modelo basándose solo en el precio. Para cada caso, registre:
| Métrica | Luna | Terra | Sol |
|---|---|---|---|
| Tokens de entrada | |||
| Tokens de salida | |||
| Costo por solicitud | |||
| Latencia | |||
| Puntuación de calidad | |||
| Tasa de errores |
Apidog puede acelerar el paso de comparación: defina el endpoint de finalización del chat una vez, almacene el ID del modelo como variable de entorno y ejecute el mismo escenario contra los tres niveles. El visor de respuestas permite revisar el bloque usage por llamada para trabajar con conteos reales de tokens.
Si conecta GPT-5.6 por primera vez, consulte esta guía para usar la API de GPT-5.6. También puede simular el endpoint mientras espera aprobación de presupuesto y sustituirlo por tráfico real sin reescribir las pruebas. Descargue Apidog gratis para ejecutar la comparación.
El panorama general: la guerra de precios continúa
Este es el tercer movimiento importante de precios en el extremo económico de la frontera este verano. Google actualizó su nivel Flash en julio, Anthropic lanzó Claude Opus 5 a la mitad del precio de Fable 5, y OpenAI redujo Luna por debajo de ambas opciones de Gemini Flash.
La calidad sigue separando a los modelos insignia, pero para cargas por lotes la regla práctica es cada vez más clara: el modelo más barato que cumpla su umbral de calidad suele ganar.
Para evitar migraciones lentas, trate el enrutamiento de modelos como infraestructura:
- Mantenga el ID del modelo como configuración.
- Conserve un conjunto de evaluación permanente.
- Registre tokens, costo, latencia y calidad.
- Vuelva a ejecutar comparativas cuando un proveedor actualice precios.
- Use reglas de fallback para enviar casos complejos a Terra o Sol.
Preguntas frecuentes
¿Cuáles son los nuevos precios de la API de GPT-5.6?
Desde el 30 de julio de 2026:
- Luna: $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida.
- Terra: $2 de entrada y $12 de salida.
- Sol: $5 de entrada y $30 de salida, sin cambios.
Sol también incorpora un modo Rápido que cuesta el doble y ofrece procesamiento 2.5 veces más rápido.
¿GPT-5.6 Sol recibió un recorte de precio?
No. Las tarifas estándar de Sol no cambiaron. El cambio es un nuevo modo Rápido que reemplaza Procesamiento Prioritario y ofrece 2.5 veces más velocidad por el doble del precio.
¿GPT-5.6 Luna es más barato que Gemini Flash?
Según el precio de lista, sí. Luna suma $1.40 por millón de tokens entre entrada y salida, frente a $2.80 de Gemini 3.5 Flash-Lite y $9 de Gemini 3.6 Flash.
Sin embargo, precio no equivale a calidad. Ejecute ambos modelos con su propio conjunto de evaluación antes de cambiar. Si primero quiere probar una ruta gratuita, consulte cómo usar GPT-5.6 gratis.
¿Los recortes se aplican automáticamente?
Sí. Las nuevas tarifas se aplican al uso estándar de la API desde el 30 de julio de 2026 sin cambios de código. Solo debe intervenir si usa Procesamiento Prioritario en Sol, ya que será reemplazado por el modo Rápido.
Qué hacer esta semana
- Actualice su modelo de costos con las nuevas tarifas.
- Identifique tareas que Luna pueda absorber con un costo hasta un 96% menor que Sol.
- Revise si el recorte del 20% de Terra modifica sus umbrales de enrutamiento.
- Compare los tres modelos con solicitudes reales, no solo con precios de lista.
- Deje el ID del modelo en configuración para poder cambiarlo sin desplegar código.
Un escenario de prueba en Apidog, tres ID de modelo y los valores de usage son suficientes para calcular el impacto real del recorte en su aplicación.
Top comments (0)