Moonshot AI a lancé Kimi K3 le 27 juillet, et le chiffre qui compte est 2,8 billions : le total des paramètres d'une architecture à mélange d'experts comptant 896 experts spécialisés, dont 16 s'activent par token pour 104 milliards de paramètres actifs. La fenêtre de contexte est d'un million de tokens, le modèle est nativement multimodal, et les poids sont sur Hugging Face sous moonshotai/Kimi-K3 en MXFP4 4 bits, ce qui en fait le plus grand modèle publié ouvertement à ce jour. Sur l'indice d'intelligence d'Artificial Analysis, il arrive troisième, derrière Claude Fable 5 d'Anthropic et GPT-5.6 d'OpenAI.

Le prix raconte sa propre histoire. L'analyse de ChinAI qualifie la stratégie de luxe abordable : égaler la performance des vaisseaux amiraux étrangers tout en ancrant le prix au plafond du marché intérieur chinois. Le tarif mixte de K3 tourne autour de 2,30 $ par million de tokens, l'entrée en cache coûtant un dixième du tarif hors cache, et son prix de sortie est 3,5 fois celui de son prédécesseur K2.6. La concurrence domestique se tient loin en dessous : Qwen3.7 Max d'Alibaba à 1,40 $, GLM-5.2 de Zhipu à 0,90 $, DeepSeek V4 Pro à 0,18 $. Le pari, c'est que les laboratoires chinois de pointe peuvent cesser la course vers le bas, et la demande initiale l'a confirmé de la façon la moins confortable possible : deux jours après le lancement, Moonshot a suspendu les nouveaux abonnements faute de capacité de calcul et imposé des limites d'usage.

Le reste de la semaine a été de l'infrastructure. Le 29 juillet, Moonshot a publié MoonEP sous licence MIT, la bibliothèque de communication pour parallélisme d'experts qu'elle crédite d'un gain d'efficacité d'échelle de 2,5x sur K3. Sa promesse centrale est un équilibre de charge exact, chaque rang reçoit le même nombre de tokens peu importe l'asymétrie du routage, ce qui élimine la synchronisation hôte par couche qui étrangle l'entraînement des grands MoE ; FlashKDA et AgentEnv sont sortis en même temps. Le 30 juillet, AWS a publié son guide officiel de déploiement, qui définit sans le dire ce que veut dire ouvert à cette échelle : la configuration de référence est une seule instance ml.p6-b300.48xlarge portant huit GPU NVIDIA B300 Blackwell Ultra, servis par vLLM en parallélisme tensoriel sur les huit.

Pour ceux qui construisent, la semaine se résume à trois faits. Le plus grand modèle à poids ouverts de l'histoire existe et se télécharge aujourd'hui. Le faire tourner soi-même commence à un rack des accélérateurs les plus récents que NVIDIA vende, donc ouvert et accessible ne sont pas le même mot. Et le fabricant l'a tarifé comme un vaisseau amiral, pas comme un produit d'appel, puis a manqué de capacité quand même, ce qui en dit plus long sur la demande pour les modèles ouverts de classe frontière que n'importe quel tableau de benchmarks.