La cifra que importa es 80. El 30 de julio, OpenAI recorto el precio de API de GPT-5.6 Luna un 80 %, hasta 0,20 $ por millon de tokens de entrada y 1,20 $ de salida, y el de GPT-5.6 Terra un 20 %, hasta 2 $ y 12 $. Sol, el nivel superior, mantiene el precio pero gana un modo Fast: hasta 2,5 veces mas rapido por el doble de coste, en sustitucion del Priority Processing. Los recortes se anunciaron en un articulo titulado 'Advancing the price-performance frontier with GPT-5.6', un dia despues de que un texto companero explicara de donde dice la empresa que vino el margen.
Esa explicacion es la parte inusual. OpenAI dice que GPT-5.6 Sol, ejecutado dentro de Codex, reescribio y optimizo de forma autonoma kernels de produccion escritos en Triton y Gluon, sus propios lenguajes GPU de codigo abierto, reduciendo el coste de servicio de extremo a extremo un 20 %. El modelo tambien diseno y ejecuto cientos de experimentos sobre el modelo borrador de decodificacion especulativa que acelera su propia generacion de tokens, mejorando esa eficiencia mas de un 15 %, e intervino ante fallos de hardware e inestabilidad del entrenamiento por el camino. OpenAI se cuida de presentarlo como 'un proceso dirigido por humanos', y dice que los kernels escritos por la IA se validaron con FpSan, una herramienta abierta de deteccion de errores de coma flotante.
La distribucion se movio a la velocidad del precio. Los tres modelos GPT-5.6 ya estan disponibles de forma general en Amazon Bedrock, con un nuevo modo de cache explicita de prompts: lecturas facturadas con un 90 % de descuento, escrituras a 1,25 veces la tarifa sin cache, TTL de 30 minutos y hasta cuatro puntos de cache por peticion. Las afirmaciones de benchmark de la semana: Sol con razonamiento maximo supera a Claude Fable 5 de Anthropic en el indice Coding Agent de Artificial Analysis 'a menos de la mitad del coste', Terra iguala a GPT-5.5 en benchmarks de inteligencia a mitad de precio, y Luna supera a Fable 5 en Agents' Last Exam con un coste por tarea estimado un 99 % menor.
Para quienes construyen, la parte practica es simple: cualquier modelo de costes escrito en el segundo trimestre esta obsoleto hoy, y la nueva economia de la cache recompensa los prefijos de prompts estables. La letra pequena lleva mas tiempo. La cifra tan citada de que la inteligencia insignia de marzo se vende hoy a una treceava parte del precio es aritmetica de terceros, que compara la puntuacion de GPT-5.4 en un indice publico con la de Luna, no una cifra de OpenAI. Las ganancias de autooptimizacion son OpenAI midiendo a OpenAI, dentro de un proceso que ella define. Y 'el modelo se abarato a si mismo' es una afirmacion sobre infraestructura que el comprador no puede inspeccionar. Nada de eso hace las facturas menos reales. Significa que la historia de eficiencia que ahora fija los precios merece la misma lectura linea por linea que los benchmarks antes que ella.
