Veo
為什麼重要
深度解析
Google DeepMind 於 2024 年推出 Veo,作為對 OpenAI Sora 的回應,承諾生成 1080p 片段、具備出色的提示遵循能力,並理解「縮時攝影」、「空拍鏡頭」等電影語言。Veo 2 於 2024 年稍晚推出,在擬真度與物理表現上明顯躍進——物體的移動、碰撞與變形都更可信——並很快贏得同世代最逼真影片模型的聲譽。2025 年發佈的 Veo 3 帶來更大的突破:它是首個能原生生成同步音訊的主流影片模型,街道場景會伴隨車流聲,說話角色也會配上唇形同步的對白。這三個版本都不是獨立應用程式,而是嵌入 Google 的產品體系:提供給消費者的 Gemini 應用程式、供電影工作者使用的 Flow 工具,以及提供給開發者與企業的 Gemini API 和 Vertex AI。
Veo 的運作方式
Google 尚未公布完整的架構細節,但 Veo 與其他現代影片生成模型屬於同一技術家族:它在壓縮的潛在空間中以提示為條件,透過擴散過程反覆去除雜訊以生成片段,並由Diffusion Transformer設計取代較舊的 U-Net 骨幹。你可以使用文字、輸入圖像(圖像轉影片)或兩者結合來引導模型;提示中可加入真正的電影攝影術語——運鏡、鏡頭類型、鏡頭焦段與燈光風格——而模型已經過訓練,能夠遵循這些要求。消費級輸出受到刻意限制:片段長約 8 秒、最高為 1080p,讓生成時間與成本維持在可控範圍,也促使使用者組合場景,而非一次生成整部電影。Flow 可將片段延伸或串接成更長的序列,不過序列延伸得越長,視覺一致性就越容易漂移。
Veo 3 與原生音訊
Veo 3 的招牌功能是音訊。早期影片模型生成的是無聲畫面,必須在後製階段加入配音與配樂;Veo 3 則讓音軌和畫面一起生成——包括唇形同步合理的對白、環境音、擬音風格音效與音樂——因為它將音訊和影片建模成一個聯合輸出,而非兩個彼此獨立的問題。實際使用時,這項能力在簡短、描述明確的場景中效果最好:「一名脫口秀演員在小舞台上講笑話,觀眾哄堂大笑」能產生可用的節奏,這是無聲模型根本做不到的。它也能融入 Google 產品體系的其他部分,因為同一個帳號可以把影像生成與 Gemini 的文字協作能力整合至同一個 Flow 專案。不過限制確實存在:英文以外的對話明顯較弱,人群交談聲會混成一團,模型有時還會加入你從未要求的字幕或螢幕文字。
實際能在哪裡使用
Veo 並未作為獨立產品販售,而是 Google 產品中的一項能力。消費者可透過 Gemini 應用程式的付費方案使用,每個方案都包含每月生成配額;Flow 則提供更深入的控制,包括「素材」(角色與物體的參考圖)、運鏡控制,以及將片段拼接成序列的場景建構器。開發者與企業可透過 Gemini API 和 Vertex AI 使用 Veo,費用按生成影片的秒數計算,而 Veo 3 Fast 變體則犧牲部分品質,以換取更低的成本與延遲。Google 在 Veo 輸出中嵌入 SynthID 數位Watermarking(浮水印),大多數消費級輸出也帶有可見標記——這是對深度偽造疑慮的直接回應。Google 也將 Veo 整合進 YouTube 的 Dream Screen,用於 Shorts 背景,讓模型觸及主流創作者,而不只限於搶先體驗者。
物理擬真不等於理解物理
一種常見說法是,Veo 逼真的動態代表模型學會了物理。它真正學到的,是合理動態「看起來」應該是什麼樣子——也就是視覺模式的統計模型,而非模擬器。它在日常情境中的正確率高到足以騙過人眼:布料自然垂墜、水花飛濺、頭髮隨頭部擺動。但只要將它推向分布外情境,破綻便會顯現:玻璃在受到撞擊後過一會兒才碎裂、肢體與家具融為一體、球在半空中改變軌跡,而手部偶爾仍會出錯。因此,研究人員會把影片模型稱為早期世界模型,而非真正的世界模型——它們在預測過程中順帶捕捉到物理世界的實用規律,卻沒有執行背後的因果規則。實務上的啟示是一項工作流程習慣:每個鏡頭都多生成幾個版本,再留下沒有破綻的那一個。
競爭格局
Veo 的主要對手是 OpenAI 的 Sora,後者在 2025 年底以自家的同步音訊與一款配套社群應用程式回應 Veo 3。Runway、可靈 AI、Luma、Pika,以及 MiniMax 的海螺,都在同一條文字轉影片賽道上競爭,差異主要在影片長度、解析度、控制功能與價格。排行榜變動很快——某一季領先的模型,再經兩次版本更新後可能已落至中段班——因此實務工作者會依專案選擇:重視音訊與物理擬真度時選 Veo,需要更長影片、角色一致性工具或更低成本時則選替代方案。在開放陣營,萬相與 HunyuanVideo 等模型允許團隊自行託管和微調,以頂尖品質換取控制權與隱私。讓 Veo 保持領先的,與其說是某項單一功能,不如說是 Google 的分發能力——一個內建於 Gemini、YouTube 和專用電影製作工具中的模型會獲得實際使用,而這些使用又會回饋至下一個版本。