Poolside, une startup americaine, a lance Laguna S 2.1, un modele a poids ouverts concu pour le code agentique, et tout se joue sur sa taille. C'est un modele mixture of experts totalisant 118 milliards de parametres mais seulement 8 milliards actifs environ pour un token donne, ce qui le rend peu couteux a executer, et il surpasse des systemes plusieurs fois plus grands sur les benchmarks qui comptent pour le code.
Les chiffres sont l'argument. Laguna S 2.1 obtient 78,5 pour cent sur SWE-Bench Multilingual, en tete pure et simple du classement publie, et 70,2 pour cent sur Terminal-Bench 2.1 avec son mode de raisonnement active. Sur un benchmark de code a long horizon nomme DeepSWE, il obtient 40,4 pour cent contre 9,0 pour cent pour un modele DeepSeek de premier plan, tout en embarquant environ un sixieme des parametres actifs. Il tient tete a des modeles plusieurs fois plus gros, dont des systemes de DeepSeek, NVIDIA et Thinking Machines.
L'economie decoule de l'architecture. Comme seuls 8 milliards de parametres s'activent par token, le modele est peu couteux a servir, et Poolside l'a rendu gratuit sur OpenRouter aux longueurs de contexte plus courtes et jusqu'a 50 fois moins cher que les modeles de pointe a la pleine longueur d'un million de tokens. Pour les equipes dont les agents avancent laborieusement dans de longues taches de code, le prix par token et la longueur de contexte constituent toute la decision, et un petit modele ouvert qui score comme un gros change ce calcul.
Le cadrage est deliberement geopolitique. Pendant la majeure partie de l'annee ecoulee, le petit modele a poids ouverts, peu couteux et puissant a ete une specialite chinoise, avec DeepSeek, Qwen et Kimi qui donnaient le rythme et des laboratoires occidentaux livrant surtout de gros systemes fermes. Laguna S 2.1 est presente comme la reponse de l'Occident, un pari selon lequel le comportement et l'entrainement comptent plus que l'echelle brute, et selon lequel un laboratoire americain peut l'emporter sur le meme terrain ouvert et efficace que dominaient les laboratoires chinois.
La mise en garde est celle qui accompagne habituellement le tableau de benchmarks d'un jeune laboratoire. Le classement est une compilation realisee par Poolside elle-meme, et c'est l'evaluation independante et l'adoption dans le monde reel qui confirmeront si Laguna S 2.1 se comporte aussi bien en pratique que sur le graphique. Mais la direction est claire et elle compte, car le front le plus interessant de la course aux modeles en ce moment n'est pas le plus grand systeme, c'est le plus petit qui parvient encore a faire le travail.
