Runway为实时视频生成上线同步审核,有害内容曝光窗口小于0.5秒
Runway介绍其新实时视频生成模型的审核方案:在流式输出过程中同步扫描画面,若发现违规内容则中断直播流,平均审核耗时低于0.5秒。
AI解读:Runway正在准备发布实时视频生成模型,但流式输出打破了原有“先生成再审核”的模式——用户会在最终安全检查前就看见画面。所以Runway设计了一套同步审核系统,在模型向用户直播生成结果的同时把帧送去审核,一旦发现问题立即掐断。
审核基础模型用的是Zentropi的CoPE-B,它是基于Gemma-4-26B-A4B-it的LoRA适配器。Gemma是混合专家模型,总参数 25.2B,每次前向传播只激活 3.8B。这意味着分类延迟接近 4B稠密模型,但知识容量来自更大的模型。
依赖Zentropi,安全审查目前平均耗时不到 0.5 秒。也就是说,如果在输入审核阶段漏掉了某些内容,它可能在用户眼前出现不到一秒就被屏蔽。Runway测试发现最严重的问题在输入审核就会被拦截,但边缘案例偶尔会闪现违规画面,例如成人女性乳头,同步审核把曝光窗口缩到半秒以内。
这套实时审核是Runway现有分层防御的最新一层,底下还有模型级防护、红队测试、针对CSAM的哈希库和分类器扫描、自动账号处罚,以及给输出打上C2PA溯源信号。真正可能受影响的是实时视频创作者和平台审核团队,他们得到的是更快的拦截速度和更短的暴露时间,但仍无法保证零漏网。
对普通读者来说,不用急着做什么。这条新闻的实际改变是Runway为实时生成加了一道低延迟的拦截网,让“边生成边审核”在工程上成立,而不是宣布有害内容已经被消灭。
Runway在其新闻页面介绍了为实时视频生成准备的同步审核系统。该系统在模型向用户流式输出画面时,同步把生成帧发送给审核模块,如果发现违规内容,就中断直播流。Runway称,借助Zentropi的CoPE-B模型,安全审查目前平均耗时不到 0.5 秒。
Runway表示,上周分享了更多关于实时视频生成愿景的细节。随着公司准备在未来几个月发布越来越强大的实时模型,他们希望确保在审核方面做好准备。
流式输出为什么需要新的审核方式
对于非实时模型,用户提交提示词(可能还有输入图像或视频),Runway用安全分类器扫描这些输入;通过后生成输出,再对生成内容本身进行安全扫描,然后要么屏蔽,要么展示给用户。
但当生成内容在创建过程中就流式传输给用户时,用户会在最终安全检查运行之前看到生成结果。这迫使Runway重新思考审核系统。输入检查仍可进行,但必须快得多,以满足用户对整体延迟的预期;同时必须极低延迟地扫描流本身,尽快捕捉有害内容。
在视频可供下载或分享之前,Runway会运行最终安全检查,确保把视频完整上下文考虑进去后结论不会改变。单帧视频画面可能看起来没问题,但放在完整视频的上下文里可能有问题。
同步审核的技术实现
Runway设计并测试了一个新的快速审核系统。一旦用户输入通过审核,它就会同步运行。模型把生成结果作为直播流呈现给用户时,Runway将生成帧发送给审核模块。如果发现问题内容,就停止该流。
这种结构要求极低延迟。为此,Runway采用了Zentropi的CoPE-B模型,该模型有意在速度与准确性之间取得平衡。CoPE-B是建立在Gemma-4-26B-A4B-it之上的LoRA适配器。Gemma是一个混合专家模型,总参数 25.2B,但每次前向传播仅激活 3.8B。在实际运行中,这意味着每次分类的延迟接近 4B稠密模型,同时具备更大模型的知识容量。
测试中的暴露窗口与边缘案例
Runway称,使用Zentropi后,安全审查目前平均耗时不到 0.5 秒。这意味着如果某些内容在输入审核阶段被漏掉,它可能会展示给用户不到一秒,然后流被屏蔽。
在测试中,Runway发现最成问题的内容会在输入审核阶段被拦截。更容易通过初步审核的边缘案例输入,有时会在流被屏蔽前产生违禁内容的闪现,例如成人女性乳头。通过Zentropi的同步审核,曝光窗口被缩小到不到半秒。
分层防御、青少年安全与溯源
实时审核是最新一层,它位于Runway现有多层防御之上。
模型级防护是始终的第一层防线。Runway在训练开始之前过滤训练数据,并应用后训练技术,教模型避免生成某些类别的有害内容。
在任何模型发布前,Runway都会进行大量对抗性测试,包括自动化和手动。手动测试尤其会关注实时模型特有的风险,包括仅靠输入审核不太可能被屏蔽的边缘案例内容。
青少年安全方面,Runway会把所有用户提供的输入与已知的儿童性虐待材料(CSAM)哈希数据库以及CSAM专用分类器进行比对扫描,以检测此前未知的CSAM。
账号执法方面,Runway使用自动化系统检测有问题的账号;反复违反政策的用户将面临自动停用。
透明度方面,Runway实时模型的输出将带有C2PA溯源信号,就像任何其他Runway输出一样,内容可以回溯到其来源。
- 模型级防护:训练前过滤数据,后训练教模型规避特定有害内容类别。
- 红队测试:发布前自动加手动对抗测试,手动测试关注实时模型特有的边缘案例风险。
- 青少年安全:输入与CSAM哈希库和CSAM专用分类器比对。
- 账号执法:自动检测问题账号,屡次违规自动停用。
- 透明度:实时模型输出携带C2PA溯源信号。
接下来
Runway表示,随着实时生成技术发展,他们将继续迭代审核基础设施,以在最小化潜在伤害风险的同时,支持用户群体的创意表达。