Poolside, une startup américaine, a lancé Laguna S 2.1, un modèle à poids ouverts conçu pour le code agentique, et tout se joue sur sa taille. C'est un modèle mixture of experts totalisant 118 milliards de paramètres mais seulement 8 milliards actifs environ pour un token donné, ce qui le rend peu coûteux à exécuter, et il surpasse des systèmes plusieurs fois plus grands sur les benchmarks qui comptent pour le code.

Les chiffres sont l'argument. Laguna S 2.1 obtient 78,5 pour cent sur SWE-Bench Multilingual, en tête pure et simple du classement publié, et 70,2 pour cent sur Terminal-Bench 2.1 avec son mode de raisonnement activé. Sur un benchmark de code à long horizon nommé DeepSWE, il obtient 40,4 pour cent contre 9,0 pour cent pour un modèle DeepSeek de premier plan, tout en embarquant environ un sixième des paramètres actifs. Il tient tête à des modèles plusieurs fois plus gros, dont des systèmes de DeepSeek, NVIDIA et Thinking Machines.

L'économie découle de l'architecture. Comme seuls 8 milliards de paramètres s'activent par token, le modèle est peu coûteux à servir, et Poolside l'a rendu gratuit sur OpenRouter aux longueurs de contexte plus courtes et jusqu'à 50 fois moins cher que les modèles de pointe à la pleine longueur d'un million de tokens. Pour les équipes dont les agents avancent laborieusement dans de longues tâches de code, le prix par token et la longueur de contexte constituent toute la décision, et un petit modèle ouvert qui score comme un gros change ce calcul.

Le cadrage est délibérément géopolitique. Pendant la majeure partie de l'année écoulée, le petit modèle à poids ouverts, peu coûteux et puissant a été une spécialité chinoise, avec DeepSeek, Qwen et Kimi qui donnaient le rythme et des laboratoires occidentaux livrant surtout de gros systèmes fermés. Laguna S 2.1 est présenté comme la réponse de l'Occident, un pari selon lequel le comportement et l'entraînement comptent plus que l'échelle brute, et selon lequel un laboratoire américain peut l'emporter sur le même terrain ouvert et efficace que dominaient les laboratoires chinois.

La mise en garde est celle qui accompagne habituellement le tableau de benchmarks d'un jeune laboratoire. Le classement est une compilation réalisée par Poolside elle-même, et c'est l'évaluation indépendante et l'adoption dans le monde réel qui confirmeront si Laguna S 2.1 se comporte aussi bien en pratique que sur le graphique. Mais la direction est claire et elle compte, car le front le plus intéressant de la course aux modèles en ce moment n'est pas le plus grand système, c'est le plus petit qui parvient encore à faire le travail.