Le chiffre qui compte est 80. Le 30 juillet, OpenAI a baissé le prix API de GPT-5.6 Luna de 80 %, à 0,20 $ par million de tokens en entrée et 1,20 $ en sortie, et celui de GPT-5.6 Terra de 20 %, à 2 $ et 12 $. Sol, le haut de gamme, garde son prix mais gagne un mode Fast : jusqu'à 2,5 fois plus rapide pour deux fois le coût, en remplacement du Priority Processing. Les baisses ont été annoncées dans un billet intitulé 'Advancing the price-performance frontier with GPT-5.6', un jour après qu'un billet jumeau a expliqué d'où la marge venait, selon l'entreprise.

Cette explication est la partie inhabituelle. OpenAI dit que GPT-5.6 Sol, exécuté dans Codex, a recrit et optimisé de façon autonome des kernels de production écrits en Triton et Gluon, ses propres langages GPU open source, réduisant le coût de service de bout en bout de 20 %. Le modèle a aussi conçu et mené des centaines d'expériences sur le modèle brouillon de décodage spéculatif qui accélère sa propre génération de tokens, améliorant cette efficacité de plus de 15 %, et est intervenu sur des pannes matérielles et des instabilités d'entraînement en cours de route. OpenAI prend soin de présenter cela comme 'un processus dirigé par des humains', et dit que les kernels écrits par l'IA ont été validés avec FpSan, un outil open source de détection d'erreurs de virgule flottante.

La distribution a suivi le rythme des prix. Les trois modèles GPT-5.6 sont désormais disponibles en général sur Amazon Bedrock, avec un nouveau mode de cache de prompts explicite : lectures facturées avec 90 % de réduction, écritures à 1,25 fois le tarif normal, TTL de 30 minutes et jusqu'à quatre points de cache par requête. Les revendications benchmark de la semaine : Sol au raisonnement maximal bat Claude Fable 5 d'Anthropic sur l'indice Coding Agent d'Artificial Analysis 'à moins de la moitié du coût', Terra égale GPT-5.5 sur les benchmarks d'intelligence à moitié prix, et Luna dépasse Fable 5 sur Agents' Last Exam pour un coût par tâche estimé 99 % plus bas.

Pour les builders, la partie pratique est simple : tout modèle de coût écrit au deuxième trimestre est périmé aujourd'hui, et la nouvelle économie du cache récompense les préfixes de prompts stables. Les petites lignes prennent plus de temps. Le chiffre très cité selon lequel l'intelligence vedette de mars se vend un treizième du prix est une arithmétique tierce, comparant le score de GPT-5.4 sur un indice public à celui de Luna, pas un chiffre d'OpenAI. Les gains d'auto-optimisation sont OpenAI mesurant OpenAI, dans un processus qu'elle définit. Et 'le modèle s'est rendu moins cher' est une affirmation sur une infrastructure que l'acheteur ne peut inspecter. Rien de tout cela ne rend les factures moins réelles. Cela signifie que l'histoire d'efficacité qui fixe désormais les prix mérite la même lecture ligne par ligne que les benchmarks avant elle.