Poolside, una startup de Estados Unidos, ha lanzado Laguna S 2.1, un modelo de pesos abiertos concebido para la programacion agentica, y lo llamativo es su tamano. Es un modelo de mezcla de expertos con 118.000 millones de parametros en total, pero solo unos 8.000 millones activos para cualquier token dado, lo que lo hace barato de ejecutar, y esta superando a sistemas muchas veces mas grandes en los benchmarks que importan para el codigo.
Los numeros son el argumento. Laguna S 2.1 obtiene un 78,5 por ciento en SWE-Bench Multilingual, encabezando por completo la tabla de clasificacion publicada, y un 70,2 por ciento en Terminal-Bench 2.1 con su modo de razonamiento activado. En un benchmark de programacion de horizonte largo llamado DeepSWE, obtiene un 40,4 por ciento frente al 9,0 por ciento de un modelo puntero de DeepSeek, aun cargando con aproximadamente una sexta parte de los parametros activos. Se defiende frente a modelos varias veces mayores, incluidos sistemas de DeepSeek, NVIDIA y Thinking Machines.
La economia se desprende de la arquitectura. Como solo se activan 8.000 millones de parametros por token, el modelo es barato de servir, y Poolside lo ha hecho gratuito en OpenRouter con longitudes de contexto mas cortas y hasta 50 veces mas economico que los modelos de frontera con la longitud completa de un millon de tokens. Para los equipos cuyos agentes procesan tareas de programacion largas, el precio por token y la longitud de contexto lo son todo en la decision, y un modelo abierto y pequeno que puntua como uno grande cambia esa ecuacion.
El enfoque es deliberadamente geopolitico. Durante la mayor parte del ultimo ano, el modelo de pesos abiertos pequeno, barato y potente ha sido una especialidad china, con DeepSeek, Qwen y Kimi marcando el ritmo y los laboratorios occidentales lanzando en su mayoria sistemas grandes y cerrados. Laguna S 2.1 se presenta como la respuesta de Occidente, una apuesta a que el comportamiento y el entrenamiento importan mas que la escala pura, y a que un laboratorio estadounidense puede ganar en el mismo terreno abierto y eficiente que han dominado los laboratorios chinos.
La advertencia es la habitual ante la tabla de benchmarks de un laboratorio joven. La tabla de clasificacion es una recopilacion del propio Poolside, y seran la evaluacion independiente y la adopcion en el mundo real las que confirmen si Laguna S 2.1 rinde en la practica tan bien como lo hace en el grafico. Pero la direccion es clara e importa, porque el frente mas interesante en la carrera de modelos ahora mismo no es el sistema mas grande, sino el mas pequeno que aun puede hacer el trabajo.
