Poolside, una startup de Estados Unidos, ha lanzado Laguna S 2.1, un modelo de pesos abiertos concebido para la programación agéntica, y lo llamativo es su tamaño. Es un modelo de mezcla de expertos con 118.000 millones de parámetros en total, pero solo unos 8.000 millones activos para cualquier token dado, lo que lo hace barato de ejecutar, y está superando a sistemas muchas veces más grandes en los benchmarks que importan para el código.
Los números son el argumento. Laguna S 2.1 obtiene un 78,5 por ciento en SWE-Bench Multilingual, encabezando por completo la tabla de clasificación publicada, y un 70,2 por ciento en Terminal-Bench 2.1 con su modo de razonamiento activado. En un benchmark de programación de horizonte largo llamado DeepSWE, obtiene un 40,4 por ciento frente al 9,0 por ciento de un modelo puntero de DeepSeek, aún cargando con aproximadamente una sexta parte de los parámetros activos. Se defiende frente a modelos varias veces mayores, incluidos sistemas de DeepSeek, NVIDIA y Thinking Machines.
La economía se desprende de la arquitectura. Como solo se activan 8.000 millones de parámetros por token, el modelo es barato de servir, y Poolside lo ha hecho gratuito en OpenRouter con longitudes de contexto más cortas y hasta 50 veces más económico que los modelos de frontera con la longitud completa de un millón de tokens. Para los equipos cuyos agentes procesan tareas de programación largas, el precio por token y la longitud de contexto lo son todo en la decisión, y un modelo abierto y pequeño que puntúa como uno grande cambia esa ecuación.
El enfoque es deliberadamente geopolítico. Durante la mayor parte del último año, el modelo de pesos abiertos pequeño, barato y potente ha sido una especialidad china, con DeepSeek, Qwen y Kimi marcando el ritmo y los laboratorios occidentales lanzando en su mayoría sistemas grandes y cerrados. Laguna S 2.1 se presenta como la respuesta de Occidente, una apuesta a que el comportamiento y el entrenamiento importan más que la escala pura, y a que un laboratorio estadounidense puede ganar en el mismo terreno abierto y eficiente que han dominado los laboratorios chinos.
La advertencia es la habitual ante la tabla de benchmarks de un laboratorio joven. La tabla de clasificación es una recopilación del propio Poolside, y serán la evaluación independiente y la adopción en el mundo real las que confirmen si Laguna S 2.1 rinde en la práctica tan bien como lo hace en el gráfico. Pero la dirección es clara e importa, porque el frente más interesante en la carrera de modelos ahora mismo no es el sistema más grande, sino el más pequeño que aún puede hacer el trabajo.
