产品量子位·原文 2026年9月16日

生数科技发布Vidu S2:实时视频编辑、720P数字人、空间视频同日全量开放

Vidu S2包含Avatar与Editing两个细分模型,支持在正在播放的视频流中换装、换角色、换背景、换风格,数字人实时输出分辨率从540p提升到720p,并新增实时空间视频生成与编辑,发布当天全量开放、不设内测名额。

AI解读:生数科技在Vidu S1发布69天后推出Vidu S2,这次的重点不是把视频生成得更漂亮,而是把编辑搬进了正在播放的视频流里。观众看着画面,就能实时换装、换人、换背景、换画风,数字人也能在对话中途接住一张参考图,按指令拿起物品、换上指定衣服。

真正受影响的不是普通观众,而是靠视频画面吃饭的人:直播间可以在弹幕提出要求后下一秒换装,虚拟角色演出多了临场发挥的空间,短视频创作者不必再为一次换风格重跑整段视频。Vidu S2发布当天就全量开放,没有内测和名额限制,这意味着上面这些用法现在就能直接上手试,而不是等审批。

限制同样具体。Vidu S2-Avatar的实时输出从540p提升到720p,但720P本身在细节要求高的场景里并不算宽裕;实时交互要求模型生成速度跑赢播放速度,否则画面会卡成PPT;空间视频方面,团队明确承认头显对分辨率和延迟极其苛刻,画面糊会晕、延迟高会出现转头与画面打架,这部分仍在优化。

换装、换主体的效果在实测里已能保持脸部一致性和动作连贯,但仍有涂抹感和头发穿模的瑕疵。换句话说,它目前更像一个能边播边改的高效工作台,而不是一次生成就完美的成品工具。是否值得接入,取决于你能否接受这种需要现场调度的交互方式。

生数科技发布Vidu S2视频生成模型,包含Vidu S2-Avatar与Vidu S2-Editing两个细分模型,发布当天全量开放,不设内测、不限名额。

据量子位报道,Vidu S2-Avatar为实时交互模型,支持语音对话、语音控制数字人做动作,并可在实时互动中输入参考图;Vidu S2-Editing为实时视频编辑模型,可改变服装、人物、背景和视频风格。

数字人实时输出分辨率从上一代的540p提升到720p。实时空间视频作为探索方向,可基于S2-Avatar实时生成空间视频、基于S2-Editing实时编辑空间视频。

Vidu S1发布至今69天,Vidu S1与S2的全链路研发均由清华大学朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。技术报告链接为arxiv.org/pdf/2609.11638,体验入口为vidu.cn/vidu-stream。

Vidu S2-Editing:在播放中的视频流里换装、换人、换背景、换风格

Vidu S2-Editing是这次更新中最大的能力之一,对正在进行的画面提供四类实时编辑:实时人物换装、实时更换背景、实时更换主体角色、实时风格渲染。这意味着直播间的视觉效果、虚拟角色的演出、创意视频的玩法都有了更多临场发挥的空间。

实测画面显示,模型对一位正在接受采访的女士切换不同款式服装时,人物动作连贯、脸部一致性良好,服装随动作产生的形变较真实,最后一套驼色大衣的袖口半遮住女士佩戴的首饰也被处理出来。挑刺的话,第二套衣服在呈现色块时仍有一点涂抹感;人物佩戴帽子时,头发仍有一点穿模。

更换背景方面,实测中人物可在各个场景间丝滑跳女团舞;更换主体角色方面,演示把办公室中的人替换为其他形象,透视与遮挡关系能与环境融合;风格转换方面,视频全程的画面一致性与风格迁移能力表现不错。

  • 实时人物换装
  • 实时更换背景
  • 实时更换主体角色
  • 实时风格渲染

Vidu S2-Avatar:720P实时输出,互动中可递参考图

Vidu S2-Avatar把实时输出分辨率从上一代的540p提升到720p,数字角色面部和衣服上的细节更丰富。在持续互动中,人物在动、对话在继续,清晰度的提升更直观。

动作控制方面,实测用同样的跳舞、转圈、跺脚指令对比,上一代S1未能完成要求,S2则跟着指令动起来。此前S1主要是聊天互动,S2将大幅度的身体动作也纳入执行范围。

互动过程中用户可以随时递给数字人一张新图片,让它拿起图里的物品、换上指定的衣服,或进入新的场景。既能听指令做动作,又能照参考图调整内容。

  • 实时分辨率540p提升至720p
  • 支持语音控制数字人做动作
  • 支持在实时交互中输入参考图

实时空间视频:把视频转成左右眼画面送进VR头显

空间视频是一种能呈现三维立体深度和沉浸感的立体视频格式,基于人类双目立体视觉原理,用两个不同视角同时录制影像,记录景物的立体深度信息。它需要在支持空间计算的设备上观看,比如Apple Vision Pro,在普通设备上只是普通二维视频。

基于Vidu S2-Avatar,用户可以实时生成空间视频;基于Vidu S2-Editing,用户还能实时编辑空间视频。用户可以把一段普通视频实时转成空间视频,也可以把通过头显摄像头看到的真实物理世界当成画布来创作。

团队坦诚表示,头显对分辨率和延迟的要求极其苛刻,画面糊了会晕,延迟高了转头和画面会打架,这块还在持续优化中。未来团队计划从固定视角扩展到全景空间视频,让用户转头就能自由探索AI生成的场景。

  • 实时生成空间视频
  • 实时编辑空间视频
  • 普通视频可实时转空间视频
  • 头显摄像头画面可作为创作画布

技术实现:流式训练、两阶段架构与时间戳对齐

数据处理方面,团队补充了舞蹈、二维动画和三维动画等训练素材,对符合条件的视频做背景稳定处理,在保留大幅动作的同时减少镜头运动带来的干扰。标注按事件发生顺序记录动作何时开始、带来什么变化、结束后人物处于什么状态,训练时每个时间片段都有对应的条件。

流式训练的难点像一场接力:下一段画面接着上一段走,前面一点偏差会被一路传下去。Vidu S2先通过Hybrid Forcing学会逐段生成,再引入Self-Replay Forcing:先让模型连续生成一段视频,再给生成结果分块加噪,进行一次可训练的因果回放,让后续片段的训练反馈也能影响较早片段的表示。

画质与实时性方面,Vidu S2采用Backbone-Refiner两阶段架构:Backbone先在低分辨率下生成主体结构、运动和语义内容,确定画面里有什么、正在做什么;Refiner再生成细节。通过异步流水线,细节重建与后续内容生成并行推进,使模型在720P输出下不掉帧。

换装、换背景做到边播边改靠时间戳对齐:用户中途发来一张衣服图片,模型需要知道换成什么,还要知道从什么时候开始换。Vidu S2重新设计位置编码,将参考图的注入位置与时间戳对齐,让新条件从指定时间点开始生效,并保持运动与光照的连续性。

此外,Vidu S2引入基于视觉语言模型的VLM Agent,持续解析已生成的画面,跟踪画面里有什么、人物正在做什么、上一条指令是否执行完毕,再规划后续生成并在合适时机调整生成条件。强化学习方面,双向阶段采用DPO改善画质、表情、动作自然度和音画同步,流式阶段采用Streaming NFT直接优化承担持续生成任务的因果模型。

实时交互视频与传统视频生成模型路径不同:每一帧都是根据用户输入现场算出来的,模型生成速度必须跑赢播放速度,否则用户看到的是PPT式卡顿。团队用SageAttention等技术给计算提速,并通过多GPU协同调度减少模块间等待。

  • Hybrid Forcing逐段生成,Self-Replay Forcing回放纠偏
  • Backbone-Refiner两阶段架构,异步流水线并行
  • 位置编码与时间戳对齐,控制新条件生效时间点
  • VLM Agent跟踪画面状态并规划后续生成
  • 双向阶段DPO、流式阶段Streaming NFT

信息来源

量子位原始来源