La cifra que importa es 80. El 30 de julio, OpenAI recortó el precio de API de GPT-5.6 Luna un 80 %, hasta 0,20 $ por millon de tokens de entrada y 1,20 $ de salida, y el de GPT-5.6 Terra un 20 %, hasta 2 $ y 12 $. Sol, el nivel superior, mantiene el precio pero gana un modo Fast: hasta 2,5 veces más rapido por el doble de coste, en sustitución del Priority Processing. Los recortes se anunciaron en un articulo titulado 'Advancing the price-performance frontier with GPT-5.6', un día después de que un texto compañero explicara de donde dice la empresa que vino el margen.
Esa explicación es la parte inusual. OpenAI dice que GPT-5.6 Sol, ejecutado dentro de Codex, reescribio y optimizo de forma autónoma kernels de producción escritos en Triton y Gluon, sus propios lenguajes GPU de código abierto, reduciendo el coste de servicio de extremo a extremo un 20 %. El modelo también diseno y ejecutó cientos de experimentos sobre el modelo borrador de decodificación especulativa que acelera su propia generación de tokens, mejorando esa eficiencia más de un 15 %, e intervino ante fallos de hardware e inestabilidad del entrenamiento por el camino. OpenAI se cuida de presentarlo como 'un proceso dirigido por humanos', y dice que los kernels escritos por la IA se validaron con FpSan, una herramienta abierta de deteccion de errores de coma flotante.
La distribución se movió a la velocidad del precio. Los tres modelos GPT-5.6 ya están disponibles de forma general en Amazon Bedrock, con un nuevo modo de cache explicita de prompts: lecturas facturadas con un 90 % de descuento, escrituras a 1,25 veces la tarifa sin cache, TTL de 30 minutos y hasta cuatro puntos de cache por petición. Las afirmaciones de benchmark de la semana: Sol con razonamiento máximo supera a Claude Fable 5 de Anthropic en el índice Coding Agent de Artificial Analysis 'a menos de la mitad del coste', Terra iguala a GPT-5.5 en benchmarks de inteligencia a mitad de precio, y Luna supera a Fable 5 en Agents' Last Exam con un coste por tarea estimado un 99 % menor.
Para quienes construyen, la parte practica es simple: cualquier modelo de costes escrito en el segundo trimestre esta obsoleto hoy, y la nueva economía de la cache recompensa los prefijos de prompts estables. La letra pequena lleva más tiempo. La cifra tan citada de que la inteligencia insignia de marzo se vende hoy a una treceava parte del precio es aritmética de terceros, que compara la puntuación de GPT-5.4 en un índice publico con la de Luna, no una cifra de OpenAI. Las ganancias de autooptimizacion son OpenAI midiendo a OpenAI, dentro de un proceso que ella define. Y 'el modelo se abarato a si mismo' es una afirmación sobre infraestructura que el comprador no puede inspeccionar. Nada de eso hace las facturas menos reales. Significa que la historia de eficiencia que ahora fija los precios merece la misma lectura linea por linea que los benchmarks antes que ella.
