研究Runway News·原文 2026年9月11日

Runway公布实时视频生成研究:从等待成片改为边提示边流式出帧

Runway发布研究说明,介绍其通过让基础模型因果化、自回归化再蒸馏的方式实现实时视频生成;公司称目标是优化首帧时间并流式输出视频,但未给出具体延迟或成本数字。

AI解读:Runway在官方研究文章中介绍了其实现实时视频生成的技术路线:先把原有基础模型改造成按帧因果、自回归的生成器,再通过两阶段蒸馏把每帧生成压缩到几步。公司称大部分实际收益来自第二阶段(on-policy蒸馏),但文章没有给出任何延迟、吞吐或成本的量化结果。

变化在于交互模式:现在是输入提示、等几秒到几分钟、拿到一个定稿视频;如果不满意就得重来。Runway称用户在生成和迭代上花的时间是流程中最慢的部分,实时生成想让时间转移到“主动导演”而不是“被动等待”。

这篇文章的适用范围有限。它描述的是训练与推理方法,不是已上线产品的完整能力清单,也没有说明哪些模型、哪些用户、什么硬件条件下能用上实时生成,公开信息停留在方法层面。

Runway在官方研究文章中公布了其面向实时视频生成的研究进展,称这一方向的目标是优化首帧时间并随后在用户提示时流式输出视频,而非等一个完整视频渲染完成。

文章明确当前视频模型的工作方式是分阶段、每个输出是一个已经完成的成品:输入提示、等待、拿到视频。Runway表示其实时生成工作采用不同路径,这一思路在公司今年早些时候发布Runway Characters时已有讨论。

Runway称要通过因果自回归加重蒸馏把基础模型压到实时

文章称,实时视频模型的思路是在Gen-4.5等基础模型上做后训练。每一步自回归都以两个条件为依据:一是初始首帧,二是用户在开始时选择输入的描述文本。模型逐帧生成,并把已生成的latent保留在上下文中以维持质量;视频和音频解码器以因果方式运行,在latent生成时同步流式输出。

具体做法分两步。第一步是通过teacher forcing让模型因果化:把整个模型架构转换为时间上因果、逐帧的自回归生成器。Runway称此前发布的是全注意力生成方向的模型,这一步表明同一架构能干净地适配自回归设定,而不丢掉原有优势。

第二步是通过student forcing提速:因果模型仍然慢,flow matching生成一帧需要很多去噪步骤。分布匹配蒸馏把每帧降到几步,达到可以带可接受延迟进行流式传输的速度。蒸馏分两阶段进行:先off-policy,再on-policy。文章称off-policy蒸馏提供不错的起点,但生成流程中的大部分实际收益来自on-policy蒸馏过程。

Runway解释,视频生成里一个小错误会逐帧累积并被放大,不像语言模型可以通过文本在过程中自我纠正。on-policy蒸馏在训练过程中做rollout,学生模型自回归生成序列、每个生成的latent成为下一个的上下文,从而在训练时看到自己生成的上下文,帮助纠正偏移而不是放大它。文章还称使用逐渐增加序列长度的课程训练优于固定序列长度,一开始就用长序列会让轨迹在末端严重偏离教师模型。

Runway称实时生成把瓶颈从训练移到推理,但未公布延迟与成本数据

文章称,实时生成把算力瓶颈从训练转移到推理:每一帧都必须足够快地离开模型以跟上播放,且硬件要在并发会话之间共享。Runway表示正在用其内部评测和可观测性工具评估推理栈,比较不同checkpoint和硬件配置下的生成质量和延迟。

对于为什么做实时,文章给出的理由是能打破构思与创作之间的障碍,带来现有模型无法匹配的速度和控制力;模型跑得更快时占用更少GPU时间,从而更具成本效益。Runway还称,在给定质量水平下,每次输出的成本决定哪些用例可行,实时生成会把这条线推得更远。

文章没有给出首帧延迟、每秒帧数、分辨率、支持并发数或成本下降幅度的具体数字,也没有说明这套方法当前在哪些产品或模型中可用。

Runway把即时生成与机器人、自动驾驶和多人在线交互场景联系起来

文章称,即时生成是交互体验的基础,Runway认为交互体验最终会是生成式媒体最大的用例。教育、游戏、机器人等领域都依赖视频能以观看者反应的同等速度作出响应。

文章还把这一点延伸到仿真:评估机器人、自动驾驶车辆等物理智能体在世界中的行为,需要能实时生成并即时响应边缘情况的环境;Runway认为数字智能体在各类在线空间执行复杂计算机操作任务时同理。文章称这一判断正在推动其当前的大部分基础研究。

信息来源

Runway News原始来源