任少卿以通讯作者身份发表MM-Future论文,让自动驾驶同时推演多组场景与动作
蔚来团队提出多模式世界—动作联合模型,一次生成多组配对场景—动作假设,NAVSIM-v1取得94.0 PDMS,主模型单张H800前向延迟约233毫秒。
AI解读:任少卿时隔约十年重新以通讯作者身份出现在论文中,这次的题目不是计算机视觉,而是自动驾驶的世界模型与规划。他2014—2016年的代表作是Faster R-CNN、ResNet,如今署名蔚来和中国科学技术大学AGI研究院。
论文要解决的问题是:现有世界—动作模型要么能生成多条轨迹但场景与动作单向传递,要么两者能双向影响却只生成一组结果。MM-Future的做法是一次生成多组配对假设,每组内部的轨迹和未来场景共同演化,最后按配对的未来给候选打分。
这不是纯粹的学术趣味。蔚来2024年起把智驾架构转向世界模型驱动的端到端体系,2026年初最新版NWM开始大规模推送,官方称截至今年9月已部署到超过95万辆车。MM-Future代表这条路线从“预测未来”继续走向“让未来参与规划”。
限制也说得很清楚:主模型采样64组候选时,单张H800、batch size 1、bf16下端到端前向延迟约233毫秒;MM-Tokens是隐式表征,模型保留了哪些规划信息目前难以直接观察。论文结果来自NAVSIM和HUGSIM公开数据集与仿真,尚未涉及真实道路验证。
对普通车主来说,这套方法短期内不会改变车上的功能;对做端到端规划和世界模型的研究者,它提供的增量是明确且可复现的:把多模式从“多条轨迹”扩展到“多组动作与未来”,并在消融实验中逐项验证了模式数量、联合生成、配对评分各自的增益。
蔚来智能驾驶基础模型预研团队发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出一种多模式世界—动作联合模型,让自动驾驶一次生成多组“场景—动作假设”并从中选择。任少卿担任通讯作者,同时署名蔚来和中国科学技术大学AGI研究院;论文第一机构为NIO。
公开学术记录中,任少卿的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等计算机视觉工作。这是他以通讯作者身份重新出现在自动驾驶论文中。论文地址为https://arxiv.org/pdf/2609.20377。
从一条轨迹扩展到多组配对的场景与动作
端到端自动驾驶的基本逻辑,是把传感器观测直接映射为自车轨迹或控制指令。World–Action Model在此基础上增加未来场景建模,让规划既依据当前环境,也参考动作可能带来的后果。
论文把现有路线分为两类。一类是级联式:先生成几条候选轨迹再分别预测每条轨迹对应的未来场景,或先预测场景再规划。这类方案能生成多个候选,但信息单向传递,后生成的变量无法回头修正前面的决策——如果模型先确定自车向前通过路口,之后才预测到对向车辆没有减速,这个未来结果很难重新参与前面的动作生成。
另一类是联合式:场景和动作放在同一个生成过程中相互影响,但通常只生成一组场景—动作结果。论文指出的空白正在于此:级联式覆盖多种结果但缺乏双向交互,联合式有双向交互但只有单组结果。
MM-Future的方案是一次生成多组场景—动作假设,每一组内部场景和动作继续共同演化。论文把每一组结果称为paired scene–action hypothesis(配对场景—动作假设)。同一时刻,一组候选可能是自车加速、对向车辆让行,另一组是自车减速、对向车辆先行,还有不同程度的制动、通过方式与场景变化。
多样性、计算成本与筛选三道门槛
论文把多模式联合建模的难点拆成三项:多样性从哪里产生、多组未来如何控制计算成本、生成多个候选后如何筛选。
多样性方面,真实驾驶数据一段录像只记录一种已发生的结果,模型需要在单结果监督下学出多种合理结果。MM-Future在动作端根据训练轨迹分布建立Gaussian Mixture Noise,从不同动作先验出发;场景端使用独立噪声。动作与场景的初始状态两两配对,构成不同驾驶结果的独立起点。训练时加入Best-of-Many监督:一次生成多组候选,先找出与真实轨迹最接近的一组,再用同一个赢家索引监督动作流和场景流,避免所有候选被同一条真值轨迹拉向相似结果,同时保持轨迹与对应未来场景的配对。
计算成本方面,多视角视频如果按每种候选完整展开,模式数量和预测时间一增加,计算量会迅速上升。作者提出MM-Tokens,将多摄像头、多时间帧的视觉特征压缩为面向规划的紧凑表示。MM-Tokens不承担RGB图像重建,也不需要恢复完整BEV,有限的Token预算主要保留与未来演化和驾驶规划相关的信息。论文给出的注意力可视化显示,MM-Tokens关注的信息集中在道路结构、路口、前车以及周围交通参与者等区域。
共同演化与筛选方面,模型使用modality-aware Transformer同时处理动作流和场景流:共享注意力负责两类信息交互,模态专属分支保留各自统计特征。每组候选共享模型参数,但不同模式之间不交换Token。动作轨迹会随配对场景变化继续更新,场景预测也根据自车动作重新调整。生成结束后,Future-Conditioned Proposal Scorer读取历史信息和该轨迹专属的预测未来给出分数,每个候选只能读取自己配对的未来;论文还对轨迹和未来Token使用stop-gradient,避免生成器为提高评分改变输出分布。
最终推理可压缩为四步:编码历史观测,生成多组场景—动作结果,使用历史与配对未来给候选评分,输出得分最高的轨迹。
基准测试结果与消融数据
论文使用NAVSIM和HUGSIM两套基准测试。在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS;论文同一张结果表中,WAM方案DriveFuture为90.7,E2E方案DrivoR trainval为93.7。NAVSIM-v2上,MM-Future获得91.5 EPDMS,高于论文列出的UniTeD 90.1和DriveFuture 89.9。
消融实验逐项对应三个设计环节:只生成动作、仅保留一种模式时PDMS为84.1,动作候选增加到32种后提升到92.3;加入场景—动作联合生成后,单模式为85.1,32模式达到92.9;最后让评分器读取每条轨迹对应的预测未来,PDMS继续提升到93.3。论文认为,评分器带来的提升在TTC指标上最明显,说明候选专属未来主要帮助排除交互风险较高的轨迹。
训练效率方面,16模式和32模式达到0.80验证PDM分数约需3.8k steps,单模式需要17.5k steps。
计算开销、闭环测试与可解释性限制
多组未来假设带来额外计算成本。论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约233ms。16种候选的延迟和单模式方案较为接近,增加到32种后延迟明显提高,候选覆盖范围和计算成本之间仍需平衡。
闭环测试存在类似局限。MM-Future没有针对HUGSIM继续微调,在436个场景上取得32.3平均HD-Score,高于论文列出的Latent-WAM 28.9和UniAD 28.6;平均Route Completion为44.5,略低于Latent-WAM的45.9;Extreme难度下HD-Score为8.6,Latent-WAM达到18.1。
论文也主动指出可解释性问题:MM-Tokens属于隐式场景表征,模型究竟保留了哪些规划信息,目前仍难直接观察。作者计划增加辅助感知模块,把与规划相关的场景结构进一步可视化,以提升模型透明度并辅助故障诊断。
团队与蔚来的世界模型路线
MM-Future的研究团队主要来自蔚来智能驾驶基础模型预研团队。第一作者Shuai Liu同时署名NIO和中山大学计算机学院,此前已在端到端自动驾驶方向有研究积累,2025年曾以第一作者发表GaussianFusion,尝试用紧凑的高斯表示完成多传感器融合,并被NeurIPS 2025接收。
论文其他作者中,Hechangle Gong同时署名NIO和北京航空航天大学,Hao Jiang、Runlin He、Junxiang Zhan、Sheng Yang均署名NIO,Kai Huang来自中山大学。任少卿担任通讯作者,同时署名蔚来和中国科学技术大学AGI研究院。中科大官网显示,任少卿为中国科学技术大学讲席教授、通用人工智能研究所所长,同时仍是蔚来智能驾驶业务负责人。
放在蔚来技术演进中看:2024年蔚来发布NIO WorldModel和NADArch 2.0,将智能驾驶架构转向世界模型驱动的端到端体系;2025年加入全闭环强化学习;2026年初最新版NWM开始大规模推送。蔚来最新披露,截至今年9月,这套基于世界模型和全闭环强化学习的智驾系统已部署到超过95万辆车。
论文当前能支持的结论更明确:在自动驾驶规划中,同时覆盖多种可能结果、并让场景与动作保持双向交互,能够带来稳定的指标增益。这条路线仍处于公开数据集和仿真验证阶段,计算开销、隐式表征和极端场景稳定性都需要继续验证。