SLM
Por qué importa
En profundidad
La etiqueta abarca un blanco móvil, pero en la práctica significa modelos de aproximadamente 0,1B a 15B parámetros — todo lo que puedas servir en una estación de trabajo, un teléfono o una sola GPU modesta en vez de un rack de aceleradores. Lo que convirtió a los SLM en una categoría digna de nombre fue el cambio que recorrió 2024 y 2025, a veces resumido como "lo pequeño es lo nuevo grande": en vez de limitarse a escalar hacia arriba, los laboratorios comenzaron a dedicar esfuerzos a volver desproporcionadamente capaces los modelos pequeños. La serie Phi de Microsoft, Gemma de Google, los tamaños menores de Qwen de Alibaba y Ministral 3B y 8B de Mistral mostraron que un modelo con la centésima parte del tamaño de un Modelo de lenguaje grande de frontera todavía podía manejar una proporción sorprendente de las cargas cotidianas. El resultado es un ecosistema de dos niveles: modelos gigantes para problemas difíciles y abiertos, y modelos pequeños para todo lo demás.
Cómo los modelos pequeños se volvieron tan capaces
Tres técnicas explican la mayor parte del salto. La primera es la calidad de los datos: la línea Phi demostró que entrenar sobre material muy filtrado y con estilo de libro de texto enseña a un modelo pequeño más por token que una extracción web en bruto, y gran parte de ese material son ahora Datos sintéticos escritos por modelos mayores. La segunda es la Destilación, donde las salidas de un gran modelo profesor — y a veces sus distribuciones completas de probabilidad — se convierten en objetivos de entrenamiento, lo que permite al alumno absorber comportamientos que nunca podría aprender solo del texto. La tercera es la misma pila de post-entrenamiento utilizada en modelos de frontera — instruction tuning y optimización de preferencias —, comparativamente barata a pequeña escala, pero que mejora drásticamente la facilidad de uso percibida del modelo. Juntas, estas técnicas significan que un modelo 3B bien entrenado supera hoy a modelos de propósito general muchas veces mayores de hace solo unos años.
La pila de eficiencia
La cantidad bruta de parámetros es solo la mitad de la historia; la otra mitad son las herramientas que vuelven baratos los modelos pequeños. La Cuantización comprime los pesos de coma flotante de 16 bits a precisión de 8 o incluso 4 bits con una pérdida modesta de calidad, de modo que un modelo 7–8B se reduce de unos 16 GB de memoria a aproximadamente 4–5 GB, y un modelo 3B cabe en unos 2 GB. Formatos como GGUF y runtimes como llama.cpp y Ollama convirtieron esto en una experiencia de un solo comando en CPU ordinarias, sin necesidad de GPU. La misma pila funciona en teléfonos y computadoras de placa única, lo que vuelve prácticos y no meramente teóricos los asistentes en el dispositivo — incluidos los pequeños modelos locales detrás de funciones como Apple Intelligence.
Dónde demuestran su valor los SLM
El caso de producción más sólido para los SLM es el trabajo estrecho y de gran volumen. Clasificación, extracción de entidades, enrutamiento, moderación, resúmenes cortos y análisis estructurado son tareas donde un modelo 1–8B con Ajuste fino iguala con frecuencia a un modelo de frontera dirigido mediante prompts, con un costo por solicitud que puede ser varios órdenes de magnitud menor y tiempos de respuesta mucho más ágiles. Una arquitectura común es la cascada: un modelo pequeño maneja el 80–90 % fácil del tráfico y solo escala las consultas difíciles o ambiguas a un modelo grande, por lo que el modelo caro ve una fracción de la carga.
El segundo caso es la ubicación: ejecutar el modelo donde viven los datos. La inferencia en el dispositivo significa que los datos del usuario nunca salen del teléfono o de la red corporativa, lo que simplifica las revisiones de privacidad y cumplimiento, y las funciones siguen operando sin conectividad alguna. Esta es la apuesta central de la IA en el borde: inteligencia incorporada en el dispositivo en vez de alquilada a un centro de datos. Un SLM con ajuste fino también es un activo que el equipo posee por completo — pesos en disco, sin cambios silenciosos de versión ni una factura por token que crece con el éxito.
Pequeño no significa tonto
La idea equivocada común, que funciona en ambas direcciones, es que el tamaño del modelo determina su utilidad. Por un lado, los SLM modernos superan en benchmarks estándar a modelos insignia de hace apenas unos años, así que descartarlos como juguetes sencillamente está desactualizado. Por otro, los límites son reales: un modelo 3B almacena mucho menos conocimiento del mundo que uno 400B, es más débil en razonamiento de varios pasos y seguimiento de instrucciones con matices, y es propenso a la Alucinación cuando se le exige más de lo que realmente sabe. La regla práctica es la adecuación, no el tamaño: si la tarea es estrecha y puedes aplicar ajuste fino o restringir la salida, un SLM suele ser la herramienta correcta; si la tarea es abierta y exige mucho conocimiento, no lo es.