A Moonshot AI lançou o Kimi K3 em 27 de julho, e o número que importa e 2,8 trilhoes: o total de parâmetros de um projeto de mistura de especialistas com 896 especialistas, dos quais 16 se ativam por token para 104 bilhoes de parâmetros ativos. A janela de contexto e de um milhao de tokens, o modelo e nativamente multimodal, e os pesos estão no Hugging Face sob moonshotai/Kimi-K3 em MXFP4 de 4 bits, o que faz dele o maior modelo publicado abertamente ate hoje. No índice de inteligência da Artificial Analysis fica em terceiro, atras do Claude Fable 5 da Anthropic e do GPT-5.6 da OpenAI.

O preço conta a própria história. A analise da ChinAI chama a estrategia de luxo acessivel: igualar o desempenho das naus capitanias estrangeiras ancorando o preço no teto do mercado interno chines. A tarifa mista do K3 fica em torno de 2,30 $ por milhao de tokens, com entrada em cache a um decimo da tarifa sem cache, e o preço de saida e 3,5 vezes o do antecessor K2.6. A concorrência domestica fica bem abaixo: Qwen3.7 Max da Alibaba a 1,40 $, GLM-5.2 da Zhipu a 0,90 $, DeepSeek V4 Pro a 0,18 $. A aposta e que os laboratórios chineses de fronteira podem parar de correr para baixo, e a demanda inicial confirmou isso da maneira menos confortavel possível: dois dias apos o lançamento, a Moonshot suspendeu novas assinaturas por falta de capacidade de computação e impos limites de uso.

O resto da semana foi infraestrutura. Em 29 de julho a Moonshot publicou o MoonEP sob licença MIT, a biblioteca de comunicação de paralelismo de especialistas a que atribui um ganho de eficiência de escala de 2,5x no K3. Sua promessa central e equilíbrio de carga exato, cada rank recebe o mesmo número de tokens por mais enviesado que o roteamento esteja, o que elimina a sincronização por camada que estrangula o treinamento de grandes MoE; FlashKDA e AgentEnv saíram junto. Em 30 de julho, a AWS publicou seu guia oficial de implantação, que define sem dizer o que significa aberto nessa escala: a configuração de referencia e uma única instancia ml.p6-b300.48xlarge com oito GPUs NVIDIA B300 Blackwell Ultra, servidas via vLLM com paralelismo tensorial nas oito.

Para quem constroi, a semana se resume a três fatos. O maior modelo de pesos abertos da história existe e pode ser baixado hoje. Roda-lo por conta própria comeca em um rack dos aceleradores mais novos que a NVIDIA vende, então aberto e acessivel não são a mesma palavra. E o fabricante precificou como nau capitania, não como isca, e ainda assim ficou sem capacidade, o que diz mais sobre a demanda por modelos abertos de classe fronteira do que qualquer tabela de benchmarks.