Moonshot AI a suspendu les nouveaux abonnements grand public pour Kimi K3, expliquant que la demande sur une période de 48 heures a poussé le service près des limites de sa capacité de calcul. La pause est intervenue environ trois jours après le lancement. Les abonnés existants ne sont pas touchés, et l'entreprise affirme ajouter de la capacité aussi vite que possible et rouvrir les places d'abonnement par lots.

Kimi K3 est le modèle qui rendait la ruée prévisible. Sorti le 17 juillet, c'est un système à poids ouverts de 2 800 milliards de paramètres doté d'une fenêtre de contexte d'un million de tokens et de capacités multimodales natives, le plus grand modèle ouvert jamais publié, et Moonshot AI l'a assorti d'une tarification agressive. En quelques jours, il est devenu le modèle dont on parlait le plus au monde, avec des résultats de benchmarks qui, selon l'entreprise, le placent à la frontière.

La contrainte, ce sont les GPU. Moonshot AI produit une recherche de classe mondiale mais ne dispose en rien de la flotte de serveurs d'un hyperscaler américain, et les contrôles américains à l'exportation rendent l'expansion de cette flotte plus difficile. C'est un schéma désormais familier pour les laboratoires chinois, où un modèle assez bon pour faire les gros titres mondiaux dépasse immédiatement les serveurs disponibles pour le faire tourner. La suspension couvre les nouvelles inscriptions grand public, tandis que l'API et les forfaits existants continuent.

Les enjeux commerciaux dépassent la simple liste d'attente. Reuters rapporte que Moonshot AI prépare une entrée en bourse, et un modèle phare viral qui ne peut pas accepter de nouveaux clients est à la fois la meilleure et la pire des publicités pour ce processus. Il prouve la demande de la façon la plus concrète qui soit et affiche du même souffle le plafond de capacité.

Le signal plus large de cette semaine est cohérent. Kimi K3 est arrivé, Alibaba a répliqué en deux jours avec son aperçu de Qwen3.8 Max, et le goulot d'étranglement qui a mordu en premier n'était pas la qualité du modèle mais le calcul pour le servir. La demande pour les modèles de frontière à poids ouverts est réelle, immédiate et payante, et pour cette vague de la course, la capacité est la ressource rare.