研究The Decoder AI·原文 2026年9月20日

Runway展示实时视频生成研究:边描述边出画,首帧目标低于100毫秒

Runway公开其将AI视频生成变为可实时操控直播流的研究方向,提出以GWM-1逐帧生成、用自身输出训练来抑制误差累积,并称实时化可把算力负担从训练转向使用、降低单位成本门槛;公司未公布可用时间表。

AI解读:Runway这次讲的重点不是“生成一段更好的视频”,而是把生成过程本身变成一条边描述边播放的直播流。按The Decoder的报道,用户不再输入提示词后等几秒到几分钟拿成品,而是在描述的同时持续输出画面,出错也不用推倒重来。

要这样做,视频模型得逐帧生成,并且每一帧都把此前所有帧当作上下文。这带来一个语言模型没有的麻烦:文字模型能在句子中途改口,视频里前帧的小瑕疵却会被后帧继承、叠加,最后长成明显的扭曲。

Runway说它的处理办法是用模型自己的输出训练,而不只用无错误的输入喂它,让它学会修正自身偏差而不是放大偏差。这个思路并不孤单:报道提到Decart的MirageLSD在训练中故意暴露于失真图像,Google DeepMind称Genie 3能在24fps、720p下维持交互世界一致数分钟。

Runway给出的商业逻辑是成本。生成越快,占用的GPU时间越少,而在给定画质下每个输出的成本决定哪些应用经济上划得来;首帧等待和反复修改被压缩后,原本不划算的用例可能变得可行。这条推理是Runway的说法,不是已公布的效果数据。

长期看Runway把互动应用押在教育、游戏和机器人上:机器人、自动驾驶需要在虚拟环境里实时响应边缘情况,评估它们的行动。Runway已展示过为机器人生成合成训练数据的GWM Robotics;Waymo也在用基于Genie 3改造的Waymo World Model模拟现实中没遇到过的场景,比如大象、龙卷风或被淹的居民区。

但发布时间没有。3月Runway在英伟达GTC上展示过与英伟达合作的实时模型研究预览,跑在Vera Rubin平台上,目标是100毫秒内出首帧;除此之外,报道没有给出任何可用时间表。眼下能确认的是方向、架构和限制,不是能买到的产品。

Runway公开了其在实时视频生成方面的研究:用户不再是输入提示词后等待成品视频,而是边用语言描述边看到视频流输出。The Decoder的报道称,Runway希望把“想法到执行”的时间压缩到接近实时。

报道描述,今天的视频模型按分离的步骤工作:输入提示词,等几秒或几分钟,拿到一段完成的视频;如果结果不对,就从头再来。Runway称用户反复反馈最耗时的环节正是生成和修改视频,因此它的目标是尽可能缩短首帧时间,然后在用户提示的过程中持续流式输出视频。

Runway最早在3月通过Runway Characters讨论过这一路线。它使用GWM-1,即Runway在2025年12月推出的首个“通用世界模型”。GWM-1建立在Gen-4.5之上,逐帧生成视频,可接受镜头运动、机器人指令或音频作为控制输入。就在几周前,Runway还展示了Solaris,一个用Gen-4.5逐帧生成用户界面的系统,可响应点击或语音输入。

Runway称实时生成能压低等待与GPU成本

Runway主张,实时生成能缩小想法与执行之间的差距。有了即时反馈,用户大部分时间会花在主动操纵视频上,而不是等待。

Runway还指向成本:更快的模型占用更少的GPU时间,因而更具成本效率。按Runway的说法,在给定质量水平下每个输出的成本,决定了哪些应用在经济上成立;即时生成会降低这道门槛,使此前不赚钱的应用变得可行。

报道指出,Runway的实时模型在生成每个新片段时,会把此前生成的所有帧作为上下文使用。

逐帧生成的误差累积问题

文本模型可以在句子中途自我纠正,但视频模型的每一帧都建立在前一帧之上,小错误会随时间累积成明显扭曲。Runway把这一点描述为基于LLM方法的核心问题。

它的应对方式是用模型自己的输出进行训练,而不只是用无错误的输入,教模型修正自身偏差而不是放大偏差。与语言模型不同,视频模型无法回头修正更早的错误,因为每个新帧都建立在有缺陷的那一帧上。

报道提到,创业公司Decart在其实时模型MirageLSD上采用了类似思路,在训练中故意让模型接触有缺陷或失真的图像。Google DeepMind称其世界模型Genie 3能在24帧每秒、720p下让交互世界保持一致数分钟。

算力从训练转向使用,长期用例指向机器人与自动驾驶

按Runway的说法,实时生成把计算负载从训练转移到使用:模型必须以足够快的速度产出每一帧以跟上播放,同时还要运行在由多个会话共享的硬件上。

Runway认为互动应用是AI生成媒体最大的长期用例。公司称教育、游戏和机器人需要能像观看者一样快速响应的视频。评估机器人或自动驾驶车辆在现实世界中的行为,也需要能实时生成、即时响应边缘情况的环境。

Runway此前推出了GWM Robotics,这是GWM-1的一个变体,为机器人生成合成训练数据。Waymo在类似方向上使用Waymo World Model,它基于Genie 3、针对道路交通做了适配,让Waymo模拟其车队从未观察过的情形,例如遇到大象、龙卷风或被淹的居民区。按Waymo的说法,Waymo Driver在公共道路上遇到某些场景之前,已在虚拟世界中行驶了数十亿英里。

与英伟达合作的预览目标:100毫秒内出首帧

3月,Runway还在英伟达GTC大会上展示了与这家芯片厂商合作开发的实时模型研究预览。该模型运行在Vera Rubin平台上,设计目标是在100毫秒内交付第一帧。

报道称,Runway尚未公布该技术的可用时间表。

信息来源

The Decoder AI原始来源