Skip to content

Sora 与视频生成

本页速览 复盘 OpenAI Sora 从 2024 年初预告到正式上线引发的文生视频大爆发:视频扩散模型与 DiT 架构、时空 patch 化技术底座、Sora 与可灵/Runway/Veo/Pika 的产品版图,以及物理局限、深度伪造治理与评估难题。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

Sora 与视频生成 ​

2024 年 2 月 15 日深夜,OpenAI 发布了一段不到两分钟的演示视频:一位时髦女性走在霓虹闪烁的东京街头,镜头跟随她穿过街道,光影、反射、神态、运镜全部以假乱真。这不是实拍,也不是传统 CGI,而是由一段纯文本提示词直接生成的、长达约 60 秒的连续镜头。一夜之间,这条演示刷屏全球——Sora 诞生了。

Sora 把**文生视频(text-to-video)**从实验室玩具推进到了"看起来像真的电影素材"的级别,也点燃了 2024–2025 年视频生成的大爆发:快手可灵、Runway Gen、Google Veo、Pika 等产品相继入场,竞争白热化。本文复盘 Sora 从预告到上线两年间发生的一切:技术底座(视频扩散模型与 DiT)、视频生成为什么比图像难、产品版图对比、行业影响与局限。背景知识可先读扩散模型与生成式 AI与Midjourney 与图像生成。

一、2024 年 2 月:Sora 的一夜爆红 ​

时间事件
2024.02OpenAI 发布 Sora 演示视频与技术报告,引爆全球
2024.06快手发布可灵 Kling;Runway 发布 Gen-3 Alpha,视频生成快速跟进
2024.12Sora 正式上线(Sora.com,面向 ChatGPT Plus/Pro 订阅用户)
2025.05Google I/O 发布 Veo 3 / Veo 3.1
2025.06可灵 Kling 2.5、Runway Gen-4 相继发布,参数与时长竞赛升级

为什么 Sora 的预告能造成这么大的冲击?三点原因:

  1. 时长与连贯性:此前主流视频生成模型只能生成几秒钟的循环或短片段,且运动经常"漂移";Sora 一次性生成约 60 秒、运镜连贯的视频,质量直接跨了一个台阶;
  2. 世界模型(world model)的叙事:OpenAI 在技术报告里直接宣称视频生成模型是"世界模拟器(world simulators)"——如果模型能预测未来帧,是不是意味着它在学习物理规律与因果关系?这个宏大叙事把视频生成从"特效工具"抬升到了"通向 AGI 的一步"的高度;
  3. 巨头背书:OpenAI 当时刚凭 ChatGPT 站上 AI 浪潮之巅,它推出的新能力天然被视为"下一代技术方向"。

一个重要澄清

2024 年 2 月发布的只是预告:展示了少量精选演示,没有公开模型、没有开放内测、也没有披露完整论文细节,部分演示后来被指出存在"经过挑选/剪辑"的嫌疑。真正的产品化要等到 2024 年 12 月 Sora 正式上线。这提醒我们:技术预告不等于技术现实,媒体热度与工程可用性之间往往隔着几个月到一年。

二、技术底座:视频扩散模型、DiT 与时空 patch ​

1. 从图像扩散到视频扩散 ​

Sora 的技术根基仍是扩散模型,但处理对象从"一张图"变成了"一段视频"。图像扩散模型是"空间"任务:把一张图加噪、再学会去噪。视频扩散模型要同时处理"空间 + 时间":把一段视频(一摞帧)整体当作待生成对象,加噪时每一帧都加噪,去噪时神经网络要同时保证每一帧内部合理、帧与帧之间连续。早期工作如 Video Diffusion Models(Ho et al., 2022)已验证"直接在视频上做扩散"的可行性,但受限于计算量只能生成极短视频。

2. DiT:把"去噪"交给 Transformer ​

Sora 的架构核心是 DiT(Diffusion Transformer,扩散 Transformer),由 Peebles & Xie 在 2023 年提出(ICCV 2023)。此前扩散模型的骨干网络是卷积的 UNet;DiT 则把图像/视频切成一堆 patch,直接送进 Transformer 处理。这个替换的意义在于:

  • 可扩展性(scaling):Transformer 的规模法则(scaling law)在扩散任务上同样成立——模型越大、训练数据越多,生成质量越高,这让视频生成第一次搭上了"大力出奇迹"的快车道;
  • 长程依赖:注意力机制天然擅长捕捉"远处像素/帧"之间的关系,这正是视频一致性所需要的。

Sora 的具体流程可以概括为三步:

text
① 视频压缩网络(Video Compressor):
   原始视频 ──▶ 降维潜空间 ──▶ 切成时空 patch(spatiotemporal patches)

② DiT 去噪:
   带噪的 patch 序列 + 文本条件(大容量文本编码器)──▶ 逐步去噪

③ 解码:
   去噪完成的 patch 序列 ──▶ 解码器还原成视频帧

关键洞察是 "patch 即 token":视频被压缩、切成"时空块"之后,就变成了类似语言模型中 token 序列的东西,可以用注意力机制统一处理。OpenAI 的技术报告明确写道,Sora 的 patch 化与 LLM 的 token 化在思路上一致——视频生成与Transformer 与注意力机制、大语言模型在架构层面殊途同归。

3. 与 LLM 的关系:scaling law 的延伸 ​

Sora 不是"把图像模型改改就能做视频",它的许多设计直接借用了 LLM 的经验:

  • 数据规模:Sora 训练在规模空前的"视频+文本"数据上,并把图像与视频混合训练(图像被视为单帧视频);
  • 条件注入:提示词经一个大容量文本编码器编码后注入生成过程,语义理解能力强于早期图像模型所用的 CLIP;
  • 统一 token 观:因为图像被当作"单帧视频",Sora 能同时处理文生视频、图生视频、视频续写与编辑——OpenAI 称之为"能理解并模拟动态世界的基础"。

三、视频生成 vs 图像生成:难在哪 ​

视频不是"图像的序列"那么简单。从图像生成到视频生成,至少多了四道坎:

难点具体表现影响
时间一致性同一个物体在帧间不能漂移、变形、突然换装角色、背景、光影需跨帧锁定
运动物理重力、碰撞、遮挡、流体等物理规律必须合理违背物理常识的"灵异变形"是典型翻车点
时长与分辨率时长 × 分辨率 × 帧率共同决定"信息量"每多一帧、每提高一档分辨率,计算量就上一个台阶
计算成本训练与推理都比图像贵一两个数量级直接决定产品定价与开放程度

计算成本尤其值得展开:一段 60 秒 720p 的视频约有 1800 帧,而一张 1024×1024 的图像只是一个"帧"。视频生成把"空间任务"和"时间任务"打包,其训练与推理开销大致随"空间分辨率 × 时长"增长,这是文生视频产品普遍按"秒"计费、按月限额的根本原因——Sora 上线初期用户每月只能生成有限的视频,正是成本所致。推理侧的优化空间(蒸馏、量化、稀疏化)见推理优化与量化。

物理常识:视频生成最大的翻车区

给物体计数、倒水、穿墙、挥手时手指数量变化——这些在图像模型里被"单帧静态"掩盖的问题,在视频里会以"动态穿帮"的形式暴露。Sora 的演示与后续用户实测中都出现过大量此类错误,说明模型学到的是"数据相关性"而非"物理规律"。这是"世界模型"叙事与工程现实之间最大的落差。

四、2024–2025 视频生成产品版图 ​

Sora 点燃赛道后,国内外厂商在 18 个月内把视频生成做成了"军备竞赛"。截至 2025 年中,主流产品大致如下:

产品厂商发布节奏分辨率与时长(约)开放程度
SoraOpenAI2024.02 预告,2024.12 上线,2025 多次迭代1080p,单段约 20 秒(可扩展至 60 秒+)订阅制(ChatGPT Plus/Pro),Sora.com
可灵 Kling快手2024.06 发布,2025.06 Kling 2.51080p/4K,最长约 3 分钟(多镜头)App/网页,有免费额度
Runway GenRunwayGen-3(2024.06),Gen-4(2025.06)1080p,单段约 10 秒网页订阅 + API,影视向工具链
VeoGoogle DeepMindVeo(2024.05),Veo 3/3.1(2025.05)1080p,单段约 8 秒起集成进 Gemini App/Flow,有限开放
PikaPika Labs1.0(2023.12),2.0(2024.11)720p 起,约 10 秒网页,主打趣味与易用

几个值得注意的竞争维度:

  • 时长:可灵把"最长时长"打到 3 分钟(多镜头拼接),Sora 强调单段连贯性,Runway 走"电影级单镜头"路线——"长"与"稳"各有取舍;
  • 一致性:Runway Gen-4、可灵 2.x 都把"角色/场景跨镜头一致"作为主打卖点,这是从"生成单段视频"迈向"生成一段能用的内容"的关键;
  • 生态打法:Runway 做创作者工具链(剪辑、编辑 API),Google 把 Veo 嵌进 Gemini 多模态全家桶,OpenAI 把 Sora 绑进 ChatGPT 订阅——大厂都在用"视频生成"反哺自己的主战场。模型能力速查可对照模型与榜单速查。

五、应用与影响:影视、广告与真实性危机 ​

1. 内容行业的"降维打击" ​

视频生成对内容生产的冲击比图像生成更直接,因为视频是内容行业的主要载体:

  • 广告与电商:商品视频、口播素材、场景化广告大片,过去一个镜头动辄数千元,现在可以用文生视频批量出候选;
  • 影视前期:分镜(storyboard)、动态预演(previs)、概念测试,导演可以用文字快速"看到"镜头效果,大幅降低沟通成本;
  • 短视频与 UGC:普通创作者第一次拥有了"没有摄影团队也能出电影感镜头"的能力,内容供给数量激增;
  • 游戏与元宇宙:过场动画、环境视频、NPC 动态表情等素材的生成式生产,正在进入游戏管线。

2. 深度伪造风险与治理 ​

视频生成的另一面是真实性的崩塌:一段 60 秒、以假乱真的视频意味着,"眼见为实"这条社会信任的底线被进一步动摇。AI 换脸视频、名人虚假发言、伪造现场录像,这类深度伪造(deepfake)的传播成本被降到极低,2024 年以来"AI 合成的名人/高管视频"已造成多起真实诈骗案。产业与监管的应对分几层:

  • 主动水印与溯源:OpenAI 在 Sora 输出中嵌入 C2PA(Content Credentials,内容来源与真实性联盟)元数据,标注"由 AI 生成";Google 的 SynthID 把不可见水印直接写进像素,裁切、压缩后仍可检测;
  • 平台标注:主流视频平台陆续要求 AI 生成内容强制打标;
  • 立法与标识:欧盟《AI 法案》要求深度伪造明确披露;中国《人工智能生成合成内容标识办法》于 2025 年 9 月施行,要求 AI 生成内容添加显式与隐式标识——各国都在把"生成式内容的可追溯性"变成合规义务。

水印、检测与治理的更系统讨论见AI 安全与治理。

检测永远慢于生成

当生成质量足够高时,"事后检测"必然处于下风——AI 生成的内容会被另一套 AI 鉴别,而鉴别器很快又被更新的生成器绕过。因此业界共识是:主动标识(发布即打标)优于被动检测(事后鉴定),这也是 C2PA、SynthID 被主流厂商集体采用的逻辑。

六、局限与评估难题 ​

1. 模型的硬伤 ​

截至 2025 年中,即便是最先进的视频生成模型,依然有几类反复出现的失败模式:

  • 物理常识错误:物体数量、重力方向、流体与遮挡关系经常出错,长视频中尤其明显;
  • 跨场景一致性:同一角色在多段视频之间长相漂移,道具、服装无法稳定锁定;
  • 文本语义理解:复杂指令、否定句、因果关系("因为……所以……")仍然难以严格执行;
  • 生成速度与成本:高质量视频的生成以"分钟"计,商业场景下"即时出片"仍不现实。

2. 评估难:视频没有"标准答案" ​

"这段视频好不好"比"这张图好不好"更难回答,因为质量至少包含三个正交维度:单帧画质、时间一致性、运动合理性。自动指标方面,视频领域沿用了图像的思路:**FVD(Fréchet Video Distance,弗雷歇视频距离)**在特征空间比较真实与生成视频的分布,CLIP 类指标衡量"视频—文本"对齐度;但正如图像评估一样,自动指标无法反映"运动是否自然、叙事是否合理"这类主观维度,最终仍依赖大规模人工盲评(例如 LMArena 的视频 Arena,让用户对两个模型的生成结果投票)。把视频生成放到"生成式 AI 怎么被评估"的大框架下理解,见LLM 评估与基准。

一句话判断

评估视频模型,先看"长视频下物体是否保持同一",再看"运动是否符合物理直觉",最后才看单帧画质——顺序反过来,很容易被漂亮的静态帧骗过。

七、权衡与取舍 ​

  • 时长 vs 稳定性:生成越长的视频,一致性越难保证,模型普遍选择"单段短(≤20 秒)+ 多镜头拼接"的策略,用户要在"长"和"稳"之间选;
  • 质量 vs 成本:分辨率、时长、迭代轮数直接决定推理成本;商用时要按"每千次生成"核算,而不是只看 demo 效果;
  • 开放 vs 可控:网页订阅式的黑盒产品开箱即用;API 与开源路线(社区对 VideoCrafter、CogVideoX、LTX-Video 等开源视频模型的跟进)可控但工程成本高;
  • 能力 vs 责任:生成能力越强,水印、审核、合规投入越大——视频比图像更"高危",因为它的说服力更强、传播更广。

延伸阅读 ​

参考资料 ​