Veo
Pourquoi c’est important
En profondeur
Google DeepMind a présenté Veo en 2024 comme sa réponse à Sora d'OpenAI, promettant des clips 1080p avec une forte fidélité au prompt et une maîtrise du langage cinématographique comme « timelapse » ou « plan aérien ». Veo 2 est arrivé plus tard en 2024 avec un net saut de réalisme et de physique — des objets qui se déplacent, entrent en collision et se déforment de façon plus plausible — et s'est vite forgé une réputation de modèle vidéo le plus réaliste de sa génération. Veo 3, sorti en 2025, a marqué la vraie rupture : le premier modèle vidéo grand public à générer nativement un audio synchronisé, si bien qu'une scène de rue arrive avec son bruit de circulation et un personnage qui parle avec des dialogues synchronisés sur les lèvres. Plutôt qu'une application autonome, les trois versions vivent à l'intérieur de la pile de produits Google : l'application Gemini pour le grand public, l'outil Flow pour les cinéastes, et l'API Gemini et Vertex AI pour les développeurs et les entreprises.
Comment fonctionne Veo
Google n'a pas publié le détail complet de l'architecture, mais Veo appartient à la même famille de techniques que les autres modèles modernes de génération de vidéos : un processus de diffusion qui débruite itérativement un clip dans un espace latent compressé, conditionné par le prompt, avec des conceptions de type Diffusion Transformer remplaçant les anciennes ossatures U-Net. Vous le pilotez avec du texte, une image d'entrée (image-vers-vidéo) ou les deux, et le vocabulaire de prompts inclut de vrais termes de cinéma — mouvements de caméra, types de plans, objectifs, styles d'éclairage — que le modèle est entraîné à suivre. Les sorties grand public sont délibérément contraintes : les clips durent environ huit secondes à jusqu'à 1080p, ce qui garde le temps et le coût de génération gérables et pousse les utilisateurs à assembler des scènes plutôt qu'à tourner des films en une prise. Flow permet d'étendre ou d'enchaîner les clips en séquences plus longues, même si la cohérence visuelle dérive à mesure qu'une séquence s'étire.
Veo 3 et l'audio natif
La fonctionnalité phare de Veo 3 est l'audio. Les modèles vidéo antérieurs produisaient des images muettes qu'il fallait sonoriser et doubler en post-production; Veo 3 génère la bande-son en même temps que les images — dialogues avec une synchro labiale plausible, sons d'ambiance, effets de type bruitage et musique — parce qu'il modélise l'audio et la vidéo comme une seule sortie conjointe plutôt que comme deux problèmes séparés. En pratique, cela fonctionne mieux pour des scènes courtes et bien spécifiées : « un humoriste sur une petite scène raconte une blague, le public rit » produit un timing utilisable qu'un modèle muet ne peut tout simplement pas atteindre. Cela s'intègre aussi au reste de la pile Google, puisque le même compte peut réunir la génération d'images et l'aide textuelle de Gemini dans un même projet Flow. Les limites sont réelles cependant : les dialogues hors de l'anglais sont nettement plus faibles, le brouhaha d'une foule se dissout en bouillie, et le modèle ajoute parfois des sous-titres ou du texte à l'écran que vous n'avez jamais demandés.
Où peut-on vraiment l'utiliser
Veo n'est pas vendu comme un produit autonome; c'est une capacité à l'intérieur des produits Google. Le grand public y accède via les paliers payants de l'application Gemini, qui incluent un quota mensuel de générations, tandis que Flow expose les contrôles plus profonds : ingrédients (images de référence pour les personnages et les objets), contrôles de caméra et un constructeur de scènes pour assembler les clips en séquences. Les développeurs et les entreprises obtiennent Veo via l'API Gemini et Vertex AI, facturés à la seconde de vidéo générée, avec des variantes Veo 3 Fast qui échangent un peu de qualité contre un coût et une latence réduits. Google intègre son filigrane numérique SynthID dans les sorties de Veo, et la plupart des sorties grand public portent aussi une marque visible — une réponse directe aux inquiétudes liées aux deepfakes. Google a aussi intégré Veo à Dream Screen de YouTube pour les arrière-plans des Shorts, mettant le modèle devant les créateurs grand public plutôt que devant les seuls early adopters.
Le réalisme physique n'est pas la compréhension de la physique
Une affirmation courante veut que le mouvement réaliste de Veo signifie que le modèle a appris la physique. Ce qu'il a réellement appris, c'est à quoi ressemble un mouvement plausible — un modèle statistique de motifs visuels, pas un simulateur. Il réussit les cas quotidiens assez souvent pour tromper l'œil : le tissu se drape, l'eau éclabousse, les cheveux suivent la tête. Poussez-le hors distribution et les coutures apparaissent : un verre qui se brise après l'impact, des membres qui fusionnent avec les meubles, des balles qui changent de trajectoire en plein vol, et les mains restent un point faible occasionnel. C'est pourquoi les chercheurs décrivent les modèles vidéo comme des proto-modèles du monde plutôt que comme des modèles du monde — ils capturent des régularités utiles sur le monde physique comme sous-produit de la prédiction, mais ils n'exécutent pas les règles causales en dessous. La leçon pratique est une habitude de travail : générez plusieurs prises de chaque plan et gardez celle où rien ne casse.
Le paysage concurrentiel
Le principal rival de Veo est Sora d'OpenAI, qui a répondu à Veo 3 avec son propre audio synchronisé et une application sociale compagnon fin 2025. Runway, Kling, Luma, Pika et Hailuo de MiniMax se disputent le même axe texte-vers-vidéo, différenciés par la durée des clips, la résolution, les fonctionnalités de contrôle et le prix. Le classement change vite — un modèle en tête un trimestre peut se retrouver au milieu du peloton deux versions plus tard — donc les praticiens choisissent par projet : Veo quand l'audio et le réalisme physique comptent, une alternative quand il faut des clips plus longs, un outillage de cohérence des personnages ou un coût moindre. Côté ouvert, des modèles comme Wan et HunyuanVideo permettent aux équipes de s'auto-héberger et d'ajuster, échangeant la qualité maximale contre le contrôle et la confidentialité. Ce qui maintient Veo près de l'avant, c'est moins une fonctionnalité isolée que la distribution de Google — un modèle livré dans Gemini, YouTube et un outil de création cinématographique dédié est utilisé, et cet usage nourrit la version suivante.