Veo
为什么重要
深度解析
Google DeepMind 于 2024 年推出 Veo,作为对 OpenAI Sora 的回应,承诺生成 1080p 片段,具有强大的提示遵循能力,并理解“延时摄影”“航拍镜头”等电影语言。Veo 2 在 2024 年晚些时候到来,真实感和物理表现有明显飞跃——物体的移动、碰撞和形变更加可信——并很快赢得了同代最逼真视频模型的声誉。2025 年发布的 Veo 3 是更大的突破:首个原生生成同步音频的主流视频模型,街道场景自带交通噪音,说话的角色配有唇形同步的对话。这三个版本都不是独立应用,而是嵌入 Google 的产品体系:面向消费者的 Gemini 应用、面向电影人的 Flow 工具,以及面向开发者和企业的 Gemini API 与 Vertex AI。
Veo 的工作原理
Google 没有公布完整的架构细节,但 Veo 与其他现代视频生成模型属于同一技术家族:在压缩的潜空间中以提示词为条件,通过扩散过程迭代地去噪生成片段,扩散Transformer设计取代了旧的 U-Net 主干。你可以用文本、输入图像(图像到视频)或两者结合来引导它,提示词汇表包含真实的电影摄影术语——运镜、镜头类型、焦段、布光风格——模型经过训练能够遵循。消费级输出被刻意限制:片段约 8 秒、最高 1080p,这使生成时间和成本可控,并引导用户去组装场景而不是一次生成整部电影。Flow 允许你将片段扩展或串联成更长的序列,尽管序列拉得越长,视觉一致性就越会漂移。
Veo 3 与原生音频
Veo 3 的招牌功能是音频。早期的视频模型生成的是无声画面,必须在后期配音配乐;Veo 3 则将音轨与画面一起生成——唇形同步合理的对话、环境音、拟音风格的音效和音乐——因为它把音频和视频建模为一个联合输出,而不是两个独立的问题。实践中,这对简短、描述明确的场景效果最好:“小舞台上的单口喜剧演员讲了个段子,观众哄堂大笑”能得到可用的节奏,而无声模型根本做不到。它也融入了 Google 产品体系的其余部分,因为同一个账号可以把图像生成和 Gemini 的文本能力整合进一个 Flow 项目。不过局限是真实存在的:英语以外的对话明显较弱,人群嘈杂声会糊成一团,模型有时还会加上你从未要求的字幕或屏幕文字。
你在哪里能真正用到它
Veo 不作为独立产品出售;它是 Google 产品中的一项能力。消费者通过 Gemini 应用的付费档使用它,付费档包含每月生成配额;Flow 则暴露更深层的控制:配料(角色和物体的参考图)、运镜控制,以及把片段拼接成序列的场景构建器。开发者和企业可通过 Gemini API 和 Vertex AI 使用 Veo,按生成视频的秒数计费,Veo 3 Fast 变体用部分质量换取更低的成本和延迟。Google 在 Veo 的输出中嵌入了 SynthID 数字水印,大多数消费级输出还带有可见标识——这是对深度伪造担忧的直接回应。Google 还将 Veo 整合进 YouTube 的 Dream Screen 用于 Shorts 背景,让模型触达主流创作者,而不仅是早期尝鲜者。
物理真实感不等于物理理解
一种常见说法是,Veo 逼真的运动意味着模型学会了物理。它真正学会的是合理的运动“看起来”是什么样——一个视觉模式的统计模型,而不是模拟器。它在日常情形上正确得足以骗过眼睛:布料垂坠、水花飞溅、头发跟随头部摆动。但一旦推到分布之外,破绽就会显现:玻璃在撞击之后才碎裂、肢体与家具融为一体、球在半空改变轨迹,而手部仍然时有翻车。这就是为什么研究者把视频模型称为原始世界模型而非真正的世界模型——它们作为预测的副产品捕捉了关于物理世界的有用规律,但并不运行底层的因果规则。实践中的启示是一种工作流习惯:任何镜头都多生成几条,留下没有破绽的那一条。
竞争格局
Veo 的主要对手是 OpenAI 的 Sora,后者在 2025 年底以自己的同步音频和一款配套社交应用回应了 Veo 3。Runway、可灵 AI、Luma、Pika 和 MiniMax 的海螺在同一文本到视频赛道上竞争,差异体现在片段时长、分辨率、控制功能和价格上。排行榜更迭很快——一个季度领先的模型,两个版本之后可能就落到中游——所以从业者按项目选择:当音频和物理真实感重要时选 Veo,当需要更长片段、角色一致性工具或更低成本时选替代品。在开放阵营,万相和 HunyuanVideo 等模型允许团队自托管和微调,用顶级质量换取控制权和隐私。让 Veo 保持在前列的,与其说是某项单一功能,不如说是 Google 的分发能力——一个装进 Gemini、YouTube 和专门电影制作工具的模型会被真正使用,而这些使用又会反哺下一个版本。