O número que importa e 80. No dia 30 de julho, a OpenAI cortou o preço de API do GPT-5.6 Luna em 80%, para US$ 0,20 por milhao de tokens de entrada e US$ 1,20 de saida, e o do GPT-5.6 Terra em 20%, para US$ 2 e US$ 12. O Sol, a camada de topo, mantem o preço mas ganha um modo Fast: ate 2,5 vezes mais rápido pelo dobro do custo, substituindo o Priority Processing. Os cortes foram anunciados num texto intitulado 'Advancing the price-performance frontier with GPT-5.6', um dia depois de um artigo irmão explicar de onde a empresa diz que veio a margem.

Essa explicação e a parte incomum. A OpenAI diz que o GPT-5.6 Sol, rodando dentro do Codex, reescreveu e otimizou de forma autônoma kernels de produção escritos em Triton e Gluon, suas próprias linguagens GPU de código aberto, cortando o custo de serviço de ponta a ponta em 20%. O modelo também desenhou e rodou centenas de experimentos sobre o modelo rascunho de decodificação especulativa que acelera sua própria geração de tokens, melhorando essa eficiência em mais de 15%, e interveio em falhas de hardware e instabilidades de treinamento no caminho. A OpenAI faz questão de apresentar isso como 'um processo liderado por humanos', e diz que os kernels escritos pela IA foram validados com o FpSan, uma ferramenta aberta de detecção de erros de ponto flutuante.

A distribuição andou na velocidade do preço. Os três modelos GPT-5.6 estão agora disponíveis em geral no Amazon Bedrock, com um novo modo de cache explícito de prompts: leituras cobradas com 90% de desconto, escritas a 1,25 vez a tarifa sem cache, TTL de 30 minutos e ate quatro pontos de cache por requisição. As alegações de benchmark da semana: o Sol com raciocínio máximo vence o Claude Fable 5 da Anthropic no índice Coding Agent da Artificial Analysis 'por menos da metade do custo', o Terra empata com o GPT-5.5 em benchmarks de inteligência pela metade do preço, e o Luna supera o Fable 5 no Agents' Last Exam com custo por tarefa estimado 99% menor.

Para quem constroi, a parte prática e simples: qualquer modelo de custo escrito no segundo trimestre esta velho hoje, e a nova economia de cache recompensa prefixos de prompt estáveis. As letras miudas levam mais tempo. A cifra muito citada de que a inteligência top de marco se vende hoje por um decimo terço do preço e aritmética de terceiros, comparando o placar do GPT-5.4 num índice público com o do Luna, não um número da OpenAI. Os ganhos de auto-otimização são a OpenAI medindo a OpenAI, dentro de um processo que ela define. E 'o modelo se tornou mais barato' e uma afirmação sobre infraestrutura que o comprador não pode inspecionar. Nada disso torna as faturas menos reais. Significa que a história de eficiência que agora define os precos merece a mesma leitura linha por linha que os benchmarks antes dela.