模型千问Qwen官方动态·原文 2026年9月18日本站收录 2026年9月19日

阿里通义发布Qwen3.8-LiveTranslate:字均延迟降至 2.3 秒,新增说话人分离与双语同屏

Qwen团队称新模型以Interleave架构把同传重构为音频-文本交织的单流形式,支持 60 种输入语言、29 种输出音频语言,并通过DashScope API提供。

AI解读:这次发布真正的新东西不是「又支持了多少语言」,而是同传开始处理「谁在说」和「前面说过什么」。Qwen团队给出的两项硬指标是:字均延迟从上一代 2.8 秒降到 2.3 秒,输入音频和输出文本各支持 60 种语言、输出音频支持 29 种。

实时说话人分离对会议、访谈、字幕类场景最直接:多人交替发言时,服务端在返回译文的同时给出说话人标识和源语言原文,不需要再单独接一个ASR接口。原文译文同帧同出则为双语字幕、内容整理和检索提供了对齐基础。

架构上,模型采用基于Hybrid MoE的Thinker–Talker双模块:Thinker把视频、音频、原文和译文排进同一条因果序列,Talker结合译文和源音频合成保留原说话人音色的译文语音。官方称在Omnilingua-MSpeaker的 14 个语向上,忠实度、流畅度、简洁度和说话人分离错误率DER四项均优于主流实时同传系统;在FLEURS的 70 个语向上,翻译质量、字均延迟、语音识别准确率、语音合成质量四项领先上一代和主流系统。

需要注意边界:这些评测结果来自Qwen团队自述,官方未公布与具体竞品的逐项分数对比,演示素材是《西游记》对话和同音词示例。延迟 2.3 秒仍意味着对话中有明显停顿感,官方把「逼近同传延迟极限」列为未来方向。

对开发者的实际变化是接入方式:新增的说话人分离和原文译文同步输出通过会话配置开启,服务端在返回译文时一并给出说话人标识与原文。真正开实时翻译功能的团队可以据此省掉一次ASR调用和自行对齐说话人的工程。

Qwen团队发布Qwen3.8-LiveTranslate实时同传模型,称其以Interleave架构把同传重构为音频-文本交织的单流形式,字均延迟(LAAL)从上一代的 2.8 秒降至 2.3 秒。

官方博客列出三项新增能力:实时说话人分离、原文译文同帧同出、长上下文消歧。前者在多人交替发言时区分不同说话人及其发言内容,并帮助译文语音更准确、稳定地保留发言人的音色;后者让原文与译文同步呈现,为字幕展示、内容整理、检索等功能提供对齐基础;长上下文消歧则结合前文和历史语境,缓解专有名词、指代带来的歧义。

架构:Hybrid MoE的Thinker–Talker双模块

官方描述模型采用基于Hybrid MoE的Thinker–Talker双模块设计,通过Interleave方式衔接流式理解、文本输出与语音生成。Thinker把视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,使理解与翻译在单一序列内完成;Talker再结合译文和源音频,把译文合成为保留原说话人音色的译文语音。

官方称本代模型将已听音频和已出译文缓存复用,翻译质量相比上代显著提升。

  • Interleave架构:音频与文本交织为单流,官方称质量更高、延迟更低
  • Thinker:视频、音频、原文、译文进同一条因果序列,端到端产出
  • Talker:结合译文与源音频,合成保留原说话人音色的译文语音
  • 字均延迟LAAL从 2.8 秒降至 2.3 秒

评测:多说话人长音频与 70 个语向

在覆盖 14 个语向的多说话人长音频评测集Omnilingua-MSpeaker上,Qwen团队称Qwen3.8-LiveTranslate在翻译的忠实度、流畅度、简洁度以及说话人识别错误率DER四个维度上均优于目前行业主流实时同传系统。

在多语言方面,官方在公开FLEURS音频测试集上评测了 70 个语向的实时同传表现,称该模型在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上领先于上一代以及当前主流实时同传系统。官方未在博客中列出与具体竞品的逐项分数。

  • Omnilingua-MSpeaker:14 个语向,忠实度、流畅度、简洁度、DER四项均称优于主流系统
  • FLEURS:70 个语向,翻译质量、字均延迟、语音识别、语音合成四项称领先上一代与主流系统
  • 评测结论均出自Qwen团队官方博客

语种范围与接入方式

输入音频与输出文本支持 60 种语言,包括中文、英语、粤语、日语、韩语、法语、德语、西班牙语、阿拉伯语、印地语、越南语、泰语、斯瓦希里语等。输出音频语言为 29 种,包括中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印度尼西亚语、阿拉伯语、越南语、土耳其语、芬兰语、波兰语、印地语、荷兰语、捷克语、乌尔都语、菲律宾语、瑞典语、丹麦语、希伯来语、冰岛语、马来语、挪威语、波斯语。

官方提供通过DashScope API使用的完整Python客户端示例:采集麦克风音频、流式发送至服务端、接收并播放译文。接入地址形如wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime,{workspace_id} 为百炼业务空间ID,官方注明其它地域URL不同。

  • 输入音频与输出文本:60 种语言
  • 输出音频:29 种语言
  • 说话人分离与原文译文同步输出通过会话配置开启,无需额外调用ASR接口
  • 会话配置中output_modalities可取 ["text", "audio"] 或 ["text"]
  • translation.corpus支持注入热词,官方称对专有名词、行业术语的识别与翻译准确率提升显著

演示与限制

官方用《西游记》中的两段对话和一组同音词示例,展示说话人归属与音色克隆、双语同步输出,以及上下文和视觉信息对翻译消歧的帮助。客户端示例中包含发送图像帧的接口input_image_buffer.append,用于把图像作为视觉上下文辅助翻译。

官方在「未来方向」中列出三项:持续压缩端到端时延,把「听到」与「译出」之间的间隔推向极限;跨会话的长期记忆,延续到同一项目、同一群人的下一次交流;覆盖更多长尾语种与区域方言。官方博客的引用条目标注为Qwen Team,月份September,年份 2026。

  • 演示素材:西游记对话与同音词,用于展示说话人归属、音色克隆、双语同步、上下文与视觉消歧
  • 客户端示例支持发送图像帧作为视觉上下文
  • 未来方向:逼近延迟极限、跨会话长期记忆、覆盖更多语种与方言
  • 上述能力与评测均来自官方博客,官方未公布第三方复现结果

信息来源