PixVerse发布实时世界模型R2,支持长会话记忆与多模态实时输入
R2在R1基础上把输入从"影响当前帧"变成"持续改写世界状态",并已在 7 月上线的PixVerse Game Engine中运行;官方开放world.pixverse.video供探索。
AI解读:PixVerse发布R2,这是对今年 1 月发布的实时世界模型R1的升级。R1证明视频可以变成连续、可交互的实时音视频流,R2要解决的是这种模式跑不长的毛病:会话一长,角色、场景和规则就容易漂移。
变化的核心在输入。普通AI视频里,一句提示只影响当下几秒,之后世界重置;R2中提示、动作、音频线索会写进世界的运行状态,影响后续角色行为、剧情走向和环境变化,且整个会话保持记忆。
R2已经落到产品层:7 月上线的PixVerse Game Engine现在跑在R2上,用WASD移动、方向键转视角,玩家可以边玩边用提示改变环境。官方开放world.pixverse.video供体验。
技术上PixVerse的说法是,把一个持续训练的因果模型(Omni Causal AR)和实时加速层建在同一底座上,避免为了实时而单独训一个更小更笨的模型。这条路线能否被第三方复现和评测,目前只有官方技术报告可查。
对做互动内容的人来说,这类模型改变的是试错成本:过去分支剧情要预先写死和制作,现在可以边玩边生成。但文章还没有给出长会话时长上限、延迟数字和成本,所以离"稳定可商用"还有待验证。
普通观众暂时不用做什么。真正值得盯的是 7 月beta开放以来创作者用它做了什么,以及PixVerse官方游戏引擎的实际稳定性——毕竟实时世界的卖点就是别崩。
PixVerse发布实时世界模型R2,作为 1 月发布的R1的升级版本。据PixVerse官方博文,R2的目标是让世界在更长会话中保持连贯,记住会话内发生的事并延续下去,同时把文本、参考、音频和动作控制接入同一个运行中的世界。
PixVerse称R1是全球首个实时世界模型,于 2026 年 1 月推出,证明了视频可以变成连续、可交互的音视频流,而非固定输出。R2在这一基础上扩展。
R2改了什么:输入不再只影响当前帧
官方描述的核心变化是输入的作用方式。在普通AI视频和之前的实时生成版本中,输入只影响当前时刻,下一动作从头开始,世界不带走任何东西。
在R2中,输入会持续存在:一个提示、一个动作或一个音频线索不只是改变当前帧,而是更新世界的运行状态,塑造后续走向——角色之后如何表现、某个情境如何收场、环境随会话推进如何发展。先前的动作在同一会话的后续仍然有效。
官方演示:WASD探索、分支剧情、有记忆的角色
PixVerse给出三个使用场景。其一,玩家进入生成的世界,用WASD键控制角色实时移动、方向键切换镜头,提示词随玩家推进改变世界,添加元素、改变环境;角色与周围环境交互时带有物理逻辑,每次输入都建立在之前输入之上。
其二,世界可发展出随玩家行为弯曲的剧情线。创作者Xiaolongbao基于R2做的互动电影游戏《Zero Mark》中,一只生物挡路并索要礼物,给它龙或给它树叶会产生真正不同的回应;故事从输入分叉,而不是沿预设路径走,模型实时生成每种结果。
其三,角色能结合上下文回应。创作者Jade Wu在R2上做的互动故事中,玩家与名为Eve的角色对话,Eve在整段对话中保持身份和记忆,引出线索、推进情节;她的回复、表情和动作同时跟随此前的对话和故事进展,在多轮交流中保持稳定身份,而不像脚本化的非玩家角色。
PixVerse同时表示,官方提供一批这样的世界供探索,入口为world.pixverse.video。
为什么难:长会话下的连贯、低延迟与错误累积
官方解释,生成固定视频片段时,模型接到单一提示、填满固定时长即可;持续运行的世界没有这种边界,必须同时、不间断地做到几件事:角色、地点和世界规则保持一致;在生成过程中接收输入,不能暂停思考;记住并恢复已发生的事,长会话中误差累积时纠正而不是放大;以及把延迟压到足够低以维持交互感。
PixVerse描述的深层矛盾是:让模型足够快通常要让它更简单,让它更强通常要让它更重更慢,速度与能力互相拉扯。官方认为业界常见的多阶段训练流水线会放大这个问题——一长串独立的训练阶段依次交接,每一次交接都损失质量和稳定性。
R2的应对是分两层、共用同一底座:Omni Causal AR作为能力引擎,类似持续训练的主干,在更多数据、更多输入类型、更多任务和更长时间跨度上持续学习;实时加速层再把同一个模型压缩到可实时运行,而不是从零训练一个单独的快速模型。
从世界模型到可玩游戏引擎
PixVerse称R2已从研究演示跨到可构建真实产品的阶段。7 月首次上线的PixVerse Game Engine现在运行在R2上。
PixVerse游戏负责人Chow Li在 9 月的Tech in Asia Conference上将其描述为游戏定义的变化:传统上构成游戏的角色、世界和玩家选择不再是预先构建的固定素材,玩家可以说出想要什么并看到它发生,体验在游玩中成形,而不是事先编写。
PixVerse联合创始人兼总裁Jaden Xie在 9 月新加坡Google AI App Day的一场座谈中表示,视频模型的进步是下一波AI原生游戏的强劲驱动力。他说:"令人兴奋的是创作者自 7 月我们开放beta以来一直在我们的世界模型上构建的东西,我们相信我们的视频模型会让更多创作者把想法变成现实。"
公司背景与可用范围
PixVerse自述为全球AI视频生成平台,用户超过 1.5 亿,覆盖 177 个以上国家和地区,模型全部自研。公司 2023 年成立,团队分布在亚洲和美国,2026 年 3 月完成C轮融资并达到独角兽估值。
官方表示R2的完整技术报告包含架构和评测细节,但本文所依据的公司博文未在正文中列出具体延迟、单次会话时长上限或成本数据。