Gemma
Por qué importa
En profundidad
Gemma llegó en 2024 como la entrada de Google en la carrera de modelos de pesos abiertos que Llama de Meta había iniciado un año antes. Creado por Google DeepMind a partir de la misma investigación y tecnología utilizadas para crear los modelos Gemini, ha pasado por tres generaciones: el Gemma original (2B y 7B parámetros), Gemma 2 (9B y 27B) y Gemma 3 (1B, 4B, 12B y 27B), que añadió comprensión de imágenes, una ventana de contexto de 128k tokens y compatibilidad con más de 140 idiomas. Todos los modelos Gemma son transformers de tipo decoder-only entrenados en las TPU de Google, y todos se publican como pesos descargables bajo una licencia personalizada que permite el uso comercial. La propuesta es sencilla: tomar la calidad del pipeline de entrenamiento de un laboratorio de frontera y reducirla hasta algo que realmente puedas ejecutar por tu cuenta.
Elegir un tamaño
El número del nombre indica la cantidad de parámetros, y cada nivel apunta a una máquina distinta. El modelo 1B se ejecuta cómodamente en teléfonos e incluso en navegadores, el 4B encaja bien en laptops y pequeños equipos de borde, el 12B es una base popular para el ajuste fino en una sola GPU de consumo, y el modelo insignia 27B necesita una GPU de estación de trabajo o un servidor pequeño, pero ofrece una calidad cercana a la de modelos propietarios muchas veces mayores. Como todos los tamaños de una generación comparten la misma arquitectura, tokenizer y receta de entrenamiento, subir o bajar por la escala más adelante es un cambio de configuración, no una reconstrucción. La decisión real contrapone la calidad por solicitud con el presupuesto de hardware — y, para uso en el dispositivo, la batería y la memoria.
Lo bastante pequeño para ejecutarse en cualquier parte
La mayor parte del uso de Gemma ocurre fuera de los centros de datos. Mediante la Cuantización a 4 bits, el modelo 4B se reduce a unos pocos gigabytes, lo que significa que se ejecuta en una laptop moderna o un teléfono insignia a velocidades legibles, y las herramientas de la comunidad hacen el trabajo pesado: llama.cpp y Ollama distribuyen builds GGUF listas para ejecutar para cada tamaño de Gemma. Esta es la tesis del modelo de lenguaje pequeño hecha realidad — un modelo que controlas, funciona sin conexión, mantiene los datos del usuario en el dispositivo y no cuesta nada por solicitud. Para aplicaciones sensibles a la privacidad, herramientas sin conexión y asistentes embebidos, esa combinación suele importar más que los últimos puntos de calidad en benchmarks. Google refuerza la propuesta con su propia compatibilidad de runtimes móviles y de navegador, inusualmente pulida frente a la de otras familias de pesos abiertos.
El ajuste fino es el plato fuerte
Como los pesos son descargables, Gemma se ha convertido en una de las familias de modelos con más ajustes finos del ecosistema. Métodos eficientes en parámetros como LoRA permiten que un profesional adapte un Gemma 4B o 12B a un trabajo de nicho — la voz de un bot de soporte, un resumidor jurídico, un clasificador especializado — en una sola GPU y en cuestión de horas, y Hugging Face aloja miles de ajustes finos comunitarios como punto de partida. Google también distribuye sus propios derivados: CodeGemma para código, PaliGemma para tareas de visión y lenguaje, y ShieldGemma para clasificación de seguridad. Parte de la fortaleza de los modelos base también procede de la Destilación, donde las salidas de un profesor mayor ayudan a entrenar el modelo más pequeño — una de las razones por las que Gemma rinde sistemáticamente por encima de lo que sugeriría su cantidad de parámetros.
Pesos abiertos no significa código abierto
Una idea equivocada común es que Gemma es de código abierto. Tiene Pesos abiertos, que es algo distinto: Google publica los archivos bajo los Términos de Uso de Gemma, una licencia personalizada que permite el uso comercial, la modificación y la redistribución, pero incorpora una política de usos prohibidos y se reserva el derecho de restringir el uso que la infrinja. En la práctica cotidiana, esto rara vez bloquea a nadie — muchas startups lanzan productos comerciales sobre Gemma sin pedir permiso — pero no ofrece la libertad de Apache 2.0, la licencia que Qwen usa para la mayoría de sus modelos, y la distinción importa si tu equipo jurídico se preocupa por la pureza de las licencias. El mismo matiz se aplica a la licencia de Llama de Meta: pesos abiertos describe lo que puedes descargar, no los términos adjuntos. Cuando alguien dice "modelo abierto", vale la pena preguntar a cuál de estas dos cosas se refiere.
Dónde encaja Gemma
Gemma compite en una categoría abarrotada con los modelos Llama más pequeños, Qwen y Phi de Microsoft, y el resumen honesto es que estas familias se adelantan unas a otras con cada lanzamiento. Las fortalezas distintivas de Gemma son su linaje de entrenamiento — pocos modelos pequeños salen del pipeline completo de un laboratorio de frontera — y la compatibilidad de primera mano para el despliegue en dispositivos. Sus límites son la otra cara de su tamaño: ningún modelo de la familia desafía a los modelos de frontera en los problemas de razonamiento más difíciles y, como cualquier modelo pequeño, almacena menos conocimiento del mundo y alucina con más facilidad que sus parientes mayores. Los equipos suelen recurrir a Gemma cuando quieren un modelo base capaz y barato de ejecutar que puedan controlar de extremo a extremo, y a un modelo de API alojado cuando la tarea necesita todo lo que ofrece un sistema de frontera.