产品The Decoder AI·原文 2026年9月20日本站收录 2026年9月21日

腾讯发布Gander:用“小脑”聊天、“大脑”干活的双模型AI助手

腾讯混元语音团队与多所高校联合推出Gander,该模型能一边进行实时语音对话,一边在后台处理复杂任务,并在Full-Duplex-Bench v3基准测试中实现了100个场景全部正确时机开口、仅8%用户打断率。

AI解读:腾讯混元语音团队与多所大学的研究者推出了Gander,一个试图让AI同时做两件事的模型:保持实时对话,并在后台处理写代码、修bug这类耗时任务。它的做法是把工作拆给两个角色——负责对话的“小脑”和负责推理的“大脑”,大脑可以换成Codex或Claude Code等智能体系统,不需要重新训练对话模型。

测试结果有喜有忧。在Full-Duplex-Bench v3基准上,Gander在100个场景里全部实现正确时机开口,打断用户的比例只有8%,远低于GPT-Realtime的13.5%和表现最弱竞品的近48%。但任务准确率略低于最弱的竞品,研究者解释部分原因是测试把语音识别和输出错误也计入了总分。

视频和音频理解也表现不佳,在一个测试中Gander的成绩不如它的基础模型,研究者将原因归结为训练时更偏向流畅对话而非精确感知。这说明要边聊边干活,目前仍要在对话时机和任务准确率之间做取舍。

Gander基于约270万个样本训练,其中部分样本教会它在背景噪音大或无人对它说话时保持安静。腾讯计划在完成开源发布流程后公开模型权重和训练数据,GitHub仓库和演示页面已经存在。研究者也承认工作尚处早期,如何扩大规模仍是未解问题,而且业界还没有评估这类系统的标准方法。

腾讯的Hunyuan Speech团队与多所大学的研究者联合推出了Gander,一个旨在一边保持对话、一边处理后台任务的AI模型。根据技术报告,它可以同时接收语音、图像和文本输入。

今天的语音助手大多与用户轮流说话,研究者认为真实对话中人们会相互打断、快速反馈、边听边说。Gander的设计目标是持续处理视频、语音和文本,即使在它说话时也不间断,用户可随时插话,模型无需提示就能提出追问或给出进度更新。

Gander被设计用于在实时对话的同时处理后台任务,例如修复bug或等待特定幻灯片出现。

“小脑”管对话,“大脑”管任务,可替换不重训

研究者认为,单一模型必须在速度和推理能力之间取舍,因此Gander将工作拆分成两个角色,借用人体解剖学命名为“小脑”和“大脑”。小脑负责实时对话,大脑在后台处理推理和复杂任务。

大脑可以替换成Codex或Claude Code等智能体系统,而不需要重新训练对话模型。在测试中,OpenAI的GPT-5.6系列中一个未指明具体型号的模型扮演了这个角色。研究者指出,随着底层模型改进,整个系统会受益。

在后台智能体修复bug时,用户可以继续提问,并把“增加Python 3.12兼容性”加入任务。

Full-Duplex-Bench v3测试:100个场景全部时机正确,打断率8%

Gander将对话切分成一秒的片段,让小脑决定何时听、说或停止(如果用户打断)。它不需要单独的语音起止检测模块来做这些决定,使用大约最近两分钟的对话作为记忆。

由于还没有针对Gander这类模型的专门测试,研究者转向了既有基准。报告称,在测试语音助手跨不同任务场景的Full-Duplex-Bench v3上,Gander的时机把握最好:在全部100个场景中都在正确时刻开始说话,打断用户的比例为8%。相比之下,GPT-Realtime为13.5%,最弱的竞品接近48%。

报告称,Gander使用相对较小的模型与GPT-Realtime、Gemini Live和Grok等商业系统竞争。Gander打断用户的频率在所有测试系统中最低,但任务准确率略低于最弱的竞品。

准确率与感知能力的代价:视频和音频理解不如基础模型

研究者解释,准确率偏低的部分原因是测试评估的是整个系统,语音识别和输出错误也被计入。当直接给文本时,大脑的得分要好得多。

视频和音频理解也受到影响:在一个测试中,Gander的表现不如它的基础模型。研究者将此归因于训练更偏向流畅对话而非精确感知,受影响的包括数物体和在图像中定位物体等任务。

训练数据与开源计划:约270万样本,权重待发布

根据报告,Gander基于约270万个样本训练。其中一些样本教它在有背景噪音或群组中无人对它说话时保持安静。研究者表示工作仍处于早期阶段。

如何扩大Gander的规模仍是未解问题,而且没有评估这类系统的标准方法。团队计划在完成“开源发布流程”后公开权重和训练数据。代码的GitHub仓库已经存在,项目页面上有演示。

行业背景:多家公司正在把智能体工作拆分给多个模型

Gander延续了腾讯今年7月发布Hy3的路线。据报道,Hy3是一个开放语言模型,缩小了与竞争对手的差距,尤其在智能体任务上。Hy3已在WorkBuddy、元宝和微信中运行。

腾讯还在谈判取得智能体初创公司Manus的最大股份,此前北京阻止了Meta的收购。腾讯认为该交易契合自身计划,包括在微信中嵌入智能体。

其他公司也在使用编排器跨模型分配任务。OpenAI的GPT-Live将对话与推理分离,在聊天继续的同时把网络搜索和智能体任务交给后台模型。Sakana AI的Fugu是一个单独的语言模型,从可扩展池中调用其他模型。OpenAI还在测试主动式智能体,无需被要求即可创建后续任务并联系用户。

处理打断和避免延迟仍是实际问题。Anthropic的一项分析发现,经验丰富的用户在约9%的工作步骤中打断Claude Code,新手约为5%。根据一项调查,构建对话式语音和聊天智能体的团队报告延迟问题的频率尤其高。

信息来源

The Decoder AI原始来源