跳到主要内容
Zubnet AI学习Wiki › Sora
模型

Sora

别名:OpenAI Sora
Sora 是 OpenAI 的视频生成模型家族,可以根据文本提示词或静态图像创作短视频。它于 2024 年 2 月首次亮相,并在同年 12 月以 Sora Turbo 之名向订阅用户开放;模型把扩散过程与 Transformer 主干结合起来,生成时间连贯的画面。第二代 Sora 2 于 2025 年底登场,加入同步音频和一款独立应用。

为什么重要

Sora 把视频生成从研究圈里的新奇玩意变成了消费产品,将过去需要摄像机、演员和剪辑软件才能完成的工作压缩进一个文本框。它也迫使人们认真面对深度伪造、肖像权和内容溯源等实际问题——如今,任何发布生成式媒体的团队都绕不过这些事。

深度解析

Sora 建立在 Diffusion Transformer 上:原始视频先被压缩到低维潜空间,再切成时空块,最后由 Transformer 去噪;它处理这些块的方式,与语言模型处理 token 很相似。2024 年 2 月,OpenAI 展示第一批片段——走在东京霓虹街头的女子、在雪地里玩耍的金毛犬——单次生成最长可达一分钟,与更早的视频生成系统,比如 Runway 和 Pika 相比,长度和连贯性的跃升一眼就能看出来。公众直到 2024 年 12 月才用上 Sora Turbo,它速度更快、价格更低,并打包进 ChatGPT 订阅;2025 年,OpenAI 又发布独立应用,核心是把真人经授权的形象放进视频的 cameo 功能,同时推出带同步对白和音效的 Sora 2。

不用像素,用时空块

在底层,Sora 把曾驱动图像生成器的扩散模型配方延伸到了时间维度。压缩网络先把原始视频挤进潜在表征,编码器再把这块潜在体积切成时空块——由空间和时间组成的小立方体,作用相当于 token。随后,Transformer 学会逆转这些块上的加噪过程:从一片噪声起步,在文本提示词的条件约束下,最终收束成一段连贯视频。

有两项训练技巧和架构本身一样重要。第一,Sora 直接用视频原本的时长、分辨率和宽高比训练,不会先把一切裁成正方形,因此同一个模型既能生成手机竖屏片段,也能生成宽银幕镜头。第二,OpenAI 复用了 DALL-E 3 的重新描述思路:由一个描述模型为训练视频写出密集而详尽的文字,让生成器获得比大多数视频数据集所附简短替代文本丰富得多的监督信号。这两招都不神秘,但放大到足够规模后,它们正是 Sora 遵循提示词的能力远胜早期系统的重要原因。

从研究预览到独立应用

2024 年 2 月的亮相只是研究预览——一组精心挑选的演示,加上给红队人员和少数艺术家的访问权限——而且这一状态持续了大半年。直到 2024 年 12 月,Sora Turbo 才在 sora.com 上向 ChatGPT Plus 和 Pro 订阅用户开放文本转视频、图像转视频和混剪工具,片段时长则远低于演示中的一分钟。OpenAI 从未公布参数量或训练数据细节,因此外界对系统的理解,大多来自它的技术报告和亲手试用。

2025 年的应用意味着 Sora 从工具转向了平台。它的 cameo 功能让用户先录一段简短的验证视频,再把自己的形象授权给朋友;得到许可后,朋友就能把这个人放进生成场景。2025 年底发布的 Sora 2 又加入同步音频——对白、音效和环境声随视频一起生成——补上了它与 Google Veo 3 之间最大的差距之一。应用最初采用邀请制,却很快冲上下载榜,这也意味着它的内容审核决策在短短几天内就被放到公众面前接受压力测试。

擅长什么,又会坏在哪里

Sora 的强项很有电影感:运镜流畅、光照可信、一次生成中能容纳多种镜头构图,风格跨度也从照片写实一路覆盖到动画。图像转视频通常是更实用的模式——用一帧静态画面当锚点,比只靠文本提示词可控得多,制作产品效果图或故事板的团队往往会从这里起步。把现有片段向时间前方或后方延展,用来拼出更长的序列,效果也出奇地好。

它出错的方式同样稳定。物理规律还是会在熟悉的地方崩掉:物体凭空出现,运动中的手和文字变得乱七八糟,倒液体、砸玻璃等因果序列逐帧看似乎都对,连成事件却不对。冗长或复杂的提示词在效果上会被悄悄截断,后面的分句直接遭到忽略;因此,视频的提示词工程不是写剧本,而是反复迭代简短、具体的场景描述。与图像模型相比,生成过程也慢得多、吃算力得多,迭代节奏更像渲染,而不是聊天。

它不是世界模拟器

OpenAI 的技术报告把规模化视频模型描述为迈向通用物理世界模拟器的一步,而这个说法值得顶回去。Sora 学到的是像素如何随时间变化的统计规律,并不是由物体、力和智能体组成的显式因果模型。这就是为什么它能造出逼真的海浪,却可能画不好一个人咬下饼干后留下咬痕——表面上像真的,不等于能追踪状态。把它看成学出来的渲染器,而不是自发涌现的物理引擎,既能校准预期,也能解释它为何既神奇又容易崩。同样的警告也适用于“视频模型已经接近强化学习意义上的真正世界模型”这类说法:表征确实惊艳,但还没有人证明它们能支持可靠的预测和规划。

同意、溯源与深度伪造难题

一个如此擅长伪造影像的模型,自然继承了整个深度伪造难题,而 OpenAI 给出的不是一道绝对防线,而是层层叠加的措施。生成视频带有可见的移动水印和嵌入式溯源元数据;cameo 要求被呈现者录制视频表示同意;政策过滤器则会拦截公众人物和某些内容类别——尽管执意绕过限制的用户已经逐项试探过这些防线。水印可以被裁掉或破坏,溯源元数据也只有在平台愿意配合时才能存活,所以最好把水印视为众多信号之一,而不是保证书。

权利问题同样悬而未决。权利人不断向 OpenAI 施压,质疑为什么生成内容里会出现受版权保护的角色,迫使公司转向退出机制和收入分成安排;cameo 模式也成了大规模肖像授权究竟该怎么运作的试验场。对任何基于生成式视频做产品的人来说,实际结论是:输出和训练数据涉及的AI与版权规则仍在移动,溯源工具应该从一开始就纳入设计,而不是等一次病毒式传播事故发生后再补上。

← 所有术语
ESC