Gemini
Por qué importa
En profundidad
Gemini no es tanto un único modelo como una línea de productos: una familia de modelos de fundamento de Google DeepMind, lanzada por generaciones (1.0, 1.5, 2.0, 2.5) y en niveles de tamaño (Nano, Flash, Pro, Ultra) que intercambian capacidad por costo y velocidad. Cada generación se entrena en el hardware TPU propio de Google, lo cual permite a la empresa controlar su pila de cómputo de extremo a extremo en vez de depender por completo de proveedores externos de chips. Los mismos modelos sustentan la aplicación de consumo Gemini, la API de Gemini en AI Studio y Vertex AI, y las funciones de IA entretejidas en Search, Android y Workspace. Google también deriva Gemma, una familia más pequeña de pesos abiertos surgida de la investigación de Gemini, para desarrolladores que necesitan pesos que puedan ejecutar por su cuenta.
De Bard a Gemini
El camino de Google hacia Gemini pasa por Bard, el chatbot que lanzó con premura en 2023 para responder al ChatGPT de OpenAI, construido primero sobre LaMDA y luego sobre el modelo PaLM 2. El debut titubeante de Bard empujó a Google a fusionar sus dos laboratorios de investigación rivales — Google Brain y DeepMind — en un único Google DeepMind en 2023, y Gemini fue el primer modelo insignia del equipo combinado. La versión 1.0 llegó a finales de 2023 en tres tamaños (Ultra, Pro y Nano); Bard cambió discretamente a Gemini Pro y, en cuestión de meses, Google retiró por completo el nombre Bard. Desde entonces, el ritmo ha sido rápido: 1.5 incorporó una arquitectura de mezcla de expertos y una ventana de contexto de un millón de tokens, 2.0 se inclinó hacia las funciones agénticas y el uso nativo de herramientas, y 2.5 convirtió el razonamiento de varios pasos en una parte estándar de la línea en lugar de un modo separado.
Un nivel para cada trabajo
Los niveles de Gemini corresponden al clásico triángulo costo-latencia-capacidad. Nano es el modelo de lenguaje pequeño de la familia: se ejecuta en el dispositivo en teléfonos Pixel y en Chrome, y maneja tareas como respuestas inteligentes y resumen sin un viaje de ida y vuelta por la red, lo que mantiene los datos locales y ofrece respuestas instantáneas. Flash ocupa el extremo en la nube de la contrapartida — un modelo destilado y optimizado para rendimiento, creado para cargas de trabajo de gran volumen donde el precio por millón de tokens importa más que exprimir los últimos puntos de benchmark. Pro es el caballo de batalla insignia para razonamiento difícil, programación y análisis multimodal, mientras que Ultra, el nivel superior de la generación 1.0, fue la apuesta de Google para las tareas más exigentes de su época. Elegir un nivel es una decisión de ingeniería, no una prueba de lealtad: muchos equipos crean prototipos con Pro y luego enrutan el tráfico fácil a Flash cuando conocen la distribución real de sus consultas.
Multimodalidad nativa
La mayoría de los sistemas Multimodal se ensamblan: se toma un modelo de texto, se le acopla un encoder de visión, se conecta una interfaz de voz a texto y se pegan las piezas durante la inferencia. Gemini se diseñó al revés — se entrenó conjuntamente desde el principio con texto, imágenes, audio y video intercalados, de modo que esas modalidades comparten un único espacio de representación en vez de pasarse notas a través de un pipeline. El beneficio práctico aparece en tareas que hacen tropezar a los sistemas por etapas: ver una hora de video y responder preguntas sobre un momento específico, razonar sobre una pizarra fotografiada o seguir una conversación hablada sin un paso independiente de transcripción. Las generaciones posteriores también generan, no solo perciben — salida y edición nativas de imágenes dentro del chat, y video mediante Veo, el modelo de video de Google, disponible en la aplicación Gemini. Aquí, la multimodalidad es una metodología de entrenamiento y no una lista de funciones, y constituye la ruptura arquitectónica más clara respecto de modelos anteriores de Google centrados primero en texto, como PaLM.
La ventana de contexto de un millón de tokens
Gemini 1.5 Pro convirtió el contexto largo en su característica principal al ofrecer una Ventana de contexto de un millón de tokens cuando la mayoría de los modelos llegaba apenas a una pequeña fracción de eso, y versiones posteriores alcanzaron los dos millones. En términos concretos, un millón de tokens equivale aproximadamente a 1.500 páginas de texto, una base de código grande o varias horas de audio y video en un solo prompt — suficiente para evitar la fragmentación y la recuperación en muchas cargas de trabajo. Eso cambia la forma de construir: en lugar de montar un pipeline de RAG, a veces puedes volcar un conjunto entero de documentos en el prompt y hacer preguntas directamente. Sin embargo, las salvedades importan. La calidad de la atención se degrada con entradas muy largas, por lo que puede pasarse por alto un detalle enterrado en el medio aunque quepa; el costo y la latencia crecen con la longitud de entrada; y cuando un corpus supera unos cuantos millones de tokens, la recuperación vuelve de todos modos. El contexto largo supone un salto real de capacidad, pero compite con la ingeniería de recuperación en lugar de sustituirla.
No existe un modelo llamado Gemini
Una fuente común de confusión: la gente dice "Gemini me dijo..." como si Gemini fuera un único modelo. Nunca lo fue. El nombre abarca una familia de modelos de distintas generaciones y niveles, una aplicación de consumo que puede enrutar tu prompt a diferentes tamaños según la carga y el nivel de suscripción, un conjunto de endpoints de API con cadenas de versión explícitas y funciones de IA dentro de Workspace y Android que ejecutan otras variantes. Dos personas que comparan notas sobre "Gemini" en la misma semana podrían estar hablando con modelos completamente distintos, y probablemente el modelo de la aplicación que usas hoy no sea el que usabas hace unos meses. Esto importa para la reproducibilidad: los resultados de benchmarks, incluidas las buenas posiciones de la familia en leaderboards públicos como Chatbot Arena, corresponden a una versión específica como Gemini 2.5 Pro, no a la marca. Cuando la precisión importa, fija la versión exacta del modelo mediante la API — la capa de comodidad de la aplicación está diseñada precisamente para ocultar esta distinción.