Saltar al contenido principal
Zubnet AIAprenderWiki › Veo
Modelos

Veo

También conocido como: Google Veo, Veo 2, Veo 3
La familia de modelos de generación de video de Google DeepMind, que convierte prompts de texto o imágenes fijas en clips de video cortos de alta resolución. La línea va del Veo original (2024) a Veo 2 y a Veo 3 (2025), la primera versión en generar audio nativo — diálogo, efectos de sonido y música — sincronizado con las imágenes. Veo se ofrece a través de la herramienta de filmmaking Flow de Google, la app Gemini y APIs para desarrolladores.

Por qué importa

Veo marcó el listón de calidad del video con IA en 2025: su realismo físico hizo que el metraje generado fuera notablemente más difícil de distinguir de las tomas reales, y el audio sincronizado de Veo 3 convirtió clips mudos en algo cercano a escenas terminadas. Para cineastas, anunciantes y equipos de contenido, llevó el video con IA de las demos novedosas a una herramienta de producción usable, y es el benchmark contra el que ahora se compara todo modelo de video rival.

En profundidad

Google DeepMind presentó Veo en 2024 como su respuesta a Sora de OpenAI, prometiendo clips en 1080p con fuerte adherencia al prompt y dominio del lenguaje cinematográfico, como “timelapse” y “toma aérea”. Veo 2 llegó más tarde en 2024 con un salto claro en realismo y física — objetos que se mueven, colisionan y se deforman de forma más plausible — y rápidamente se ganó la reputación de modelo de video más realista de su generación. Veo 3, lanzado en 2025, fue la ruptura mayor: el primer modelo de video mainstream en generar audio sincronizado de forma nativa, de modo que una escena callejera viene con ruido de tráfico y un personaje que habla viene con diálogo sincronizado con los labios. Más que una app independiente, las tres versiones viven dentro del stack de productos de Google: la app Gemini para consumidores, la herramienta Flow para cineastas, y la API de Gemini y Vertex AI para desarrolladores y empresas.

Cómo funciona Veo

Google no ha publicado los detalles completos de la arquitectura, pero Veo pertenece a la misma familia de técnicas que otros modelos modernos de generación de video: un proceso de difusión que desruida iterativamente un clip en un espacio latente comprimido, condicionado por el prompt, con diseños de diffusion transformer que reemplazan los antiguos backbones U-Net. Lo diriges con texto, una imagen de entrada (imagen-a-video) o ambos, y el vocabulario de prompts incluye términos reales de cinematografía — movimientos de cámara, tipos de plano, lentes, estilos de iluminación — que el modelo está entrenado para seguir. Las salidas de consumo están deliberadamente limitadas: los clips duran unos ocho segundos a hasta 1080p, lo que mantiene manejables el tiempo y el coste de generación y empuja a los usuarios a ensamblar escenas en lugar de películas de una sola toma. Flow permite extender o encadenar clips en secuencias más largas, aunque la coherencia visual deriva cuanto más se estira una secuencia.

Veo 3 y el audio nativo

La característica estrella de Veo 3 es el audio. Los modelos de video anteriores producían metraje mudo que había que musicar y doblar en postproducción; Veo 3 genera la banda sonora junto con los fotogramas — diálogo con sincronización labial plausible, sonido ambiental, efectos de estilo foley y música — porque modela audio y video como una salida conjunta en lugar de dos problemas separados. En la práctica esto funciona mejor con escenas cortas y bien especificadas: “un cómico en un pequeño escenario cuenta un chiste, el público ríe” produce una sincronización usable que un modelo mudo simplemente no puede. También encaja con el resto del stack de Google, ya que la misma cuenta puede traer generación de imágenes y la ayuda de texto de Gemini a un mismo proyecto de Flow. Los límites son reales, sin embargo: el diálogo fuera del inglés es notablemente más débil, el murmullo de las multitudes se difumina en un batiburrillo, y el modelo a veces añade subtítulos o texto en pantalla que nunca pediste.

Dónde puedes usarlo realmente

Veo no se vende como producto independiente; es una capacidad dentro de los productos de Google. Los consumidores llegan a él a través de los niveles de pago de la app Gemini, que incluyen una cuota mensual de generaciones, mientras que Flow expone los controles más profundos: ingredientes (imágenes de referencia para personajes y objetos), controles de cámara y un constructor de escenas para unir clips en secuencias. Los desarrolladores y las empresas obtienen Veo a través de la API de Gemini y Vertex AI, con facturación por segundo de video generado, y las variantes Veo 3 Fast cambian algo de calidad por menor coste y latencia. Google incrusta su marca de agua digital SynthID en las salidas de Veo, y la mayoría de las salidas de consumo llevan además una marca visible — una respuesta directa a las preocupaciones por los deepfakes —. Google también ha integrado Veo en Dream Screen de YouTube para fondos de Shorts, poniendo el modelo frente a creadores mainstream y no solo ante early adopters.

El realismo físico no es comprensión física

Una afirmación común es que el movimiento realista de Veo significa que el modelo ha aprendido física. Lo que realmente ha aprendido es cómo se ve el movimiento plausible — un modelo estadístico de patrones visuales, no un simulador —. Acierta en los casos cotidianos con la frecuencia suficiente para engañar al ojo: la tela cae, el agua salpica, el pelo sigue a la cabeza. Sácalo de la distribución y se notan las costuras: cristal que se rompe después del impacto, extremidades que se funden con los muebles, pelotas que cambian de trayectoria a mitad de vuelo, y las manos siguen siendo un punto débil ocasional. Por eso los investigadores describen los modelos de video como proto-modelos del mundo más que como modelos del mundo — capturan regularidades útiles sobre el mundo físico como subproducto de la predicción, pero no ejecutan las reglas causales subyacentes —. La lección práctica es un hábito de flujo de trabajo: genera varias tomas de cualquier plano y quédate con la que no se rompe nada.

El panorama competitivo

El principal rival de Veo es Sora de OpenAI, que respondió a Veo 3 con su propio audio sincronizado y una app social complementaria a finales de 2025. Runway, Kling, Luma, Pika y Hailuo de MiniMax compiten en el mismo eje de texto-a-video, diferenciados por duración de clip, resolución, funciones de control y precio. La clasificación cambia rápido — un modelo que lidera un trimestre puede quedar a mitad de tabla dos lanzamientos después —, así que los profesionales eligen por proyecto: Veo cuando importan el audio y el realismo físico, una alternativa cuando necesitan clips más largos, herramientas de coherencia de personajes o menor coste. En el lado abierto, modelos como Wan y HunyuanVideo permiten a los equipos autoalojar y ajustar, cambiando calidad puntera por control y privacidad. Lo que mantiene a Veo cerca del frente no es tanto una característica concreta como la distribución de Google — un modelo que se publica dentro de Gemini, YouTube y una herramienta de filmmaking dedicada se usa, y ese uso alimenta la siguiente versión —.

← Todos los términos
ESC