Llama
Por qué importa
En profundidad
Llama no es un modelo sino un linaje de lanzamientos de Meta AI, y entender la familia significa seguir dos hilos a la vez: la línea técnica que va de Llama 1 a Llama 4, y la línea de licencias que convirtió un artefacto de investigación en el sustrato compartido de la industria. Cada lanzamiento se publica como pesos descargables más un tokenizer y código de referencia, así que cualquiera con suficiente memoria GPU — o, para los tamaños pequeños, un portátil normal — puede ejecutar el modelo localmente, ajustarlo, cuantizarlo o integrarlo en un producto. Esa combinación de calidad creíble y control local total es lo que hizo de Llama el punto de referencia del ecosistema de pesos abiertos: cuando aparece un modelo nuevo de Mistral, Qwen o DeepSeek, la primera pregunta que se hacen los profesionales es cómo se compara con el tamaño de Llama equivalente.
De filtración de investigación a familia de productos
El LLaMA original, lanzado en febrero de 2023, era un asunto reservado a la investigación: tamaños de 7B a 65B parámetros, tras un formulario de solicitud y con licencia de uso no comercial. Los pesos completos se filtraron en cuestión de días, lo que demostró accidentalmente cuánta demanda existía de un modelo capaz que la gente pudiera ejecutar por sí misma. Meta se volcó en esa demanda con Llama 2 en julio de 2023, con tamaños de 7B, 13B y 70B bajo una licencia que permitía la mayoría de los usos comerciales, además de variantes de chat ajustadas con RLHF. La generación Llama 3 en 2024 volvió a subir el listón, entrenada con unos 15 billones de tokens: primero los tamaños de 8B y 70B, luego el buque insignia de 405B en Llama 3.1, pequeños modelos de texto de 1B y 3B más versiones con visión de 11B y 90B en 3.2, y un 70B centrado en eficiencia en 3.3. Llama 4 llegó en 2025 con una arquitectura de mezcla de expertos: Scout y Maverick como los modelos lanzados, y el mucho mayor Behemoth descrito como un modelo maestro aún en entrenamiento.
La arquitectura que se convirtió en el estándar
Arquitectónicamente, Llama es un transformer de solo decoder, y cada generación es evolutiva más que radical: pre-normalización con RMSNorm, embeddings posicionales rotatorios, capas feed-forward SwiGLU y, desde el 70B de Llama 2 en adelante, atención de consulta agrupada para reducir la caché KV en tiempo de inferencia. Ninguna de estas decisiones se inventó en Meta, pero la popularidad de Llama las convirtió en la receta de facto, y hoy la gente describe con naturalidad otros modelos como de arquitectura Llama cuando siguen la misma plantilla. Esa estandarización tiene un valor práctico real: los stacks de inferencia como vLLM, SGLang y llama.cpp se optimizan primero y con más esfuerzo para modelos con forma de Llama, y algunos laboratorios mantienen deliberadamente sus lanzamientos compatibles con Llama para que las herramientas simplemente funcionen. El vocabulario de 128k tokens de Llama 3 y la ventana de contexto de 128k tokens introducida con 3.1 se convirtieron igualmente en puntos de referencia contra los que se miden otros modelos abiertos.
Pesos abiertos no es código abierto
Una idea errónea persistente es que Llama es de código abierto. No lo es, al menos según la definición de la Open Source Initiative: la Llama Community License de Meta otorga amplios derechos de uso, modificación y redistribución de los modelos, pero incluye restricciones de campo de uso que los criterios de la OSI no admiten. Las empresas con más de 700 millones de usuarios activos mensuales necesitan una licencia aparte de Meta, la Política de Uso Aceptable restringe ciertas aplicaciones, y los modelos derivados deben incluir Llama en el nombre y mostrar la atribución “Built with Llama”. Algunos lanzamientos añaden peculiaridades regionales — los modelos multimodales Llama 3.2, por ejemplo, no tienen licencia para empresas domiciliadas en la UE —. Para un desarrollador individual o una pequeña startup nada de esto suele importar en la práctica, pero es exactamente el tipo de letra pequeña que preocupa a los equipos legales, y es la ilustración más nítida del espectro abierto vs. cerrado: los pesos descargables no son lo mismo que una licencia Apache 2.0 o MIT.
El ecosistema alrededor de los pesos
Los pesos en sí son solo la mitad de la historia; las herramientas y los derivados construidos a su alrededor son posiblemente la mayor contribución de Llama. A las pocas semanas de la filtración de Llama 1, proyectos como Alpaca y Vicuna demostraron que una barata pasada de instruction tuning con datos sintéticos podía convertir el modelo base en un chatbot usable, dando inicio a la ola moderna de ajuste fino. El llama.cpp de Georgi Gerganov hizo posible ejecutar modelos Llama cuantizados en CPUs y portátiles de consumo, engendrando el formato GGUF y todo un stack de inferencia local que incluye Ollama, mientras que Hugging Face aloja hoy decenas de miles de ajustes finos, fusiones y cuantizaciones de Llama. Gracias a la destilación y la fusión de modelos, muchos modelos abiertos supuestamente nuevos son, en el fondo, derivados de Llama. Este efecto de red se autoalimenta: como todos construyen primero para Llama, elegir Llama significa el mejor soporte de herramientas, lo que a su vez lo mantiene como el predeterminado incluso cuando un competidor publica números de benchmark ligeramente mejores.