开源Hugging Face Blog·原文 2026年9月23日本站收录 2026年9月24日

NVIDIA发布Nemotron 3 Diarization:1 亿参数开源模型,8 人说话人日志DER 14.72% 登顶VoiceArena

NVIDIA在Hugging Face博客发布开源权重说话人日志模型Nemotron 3 Diarization,支持最多 8 人、实时与离线两种模式,在VoiceArena首批Diarization-Bench中 12 个系统里排名第一。

AI解读:说话人日志解决的问题很具体:把“谁在什么时候说话”标出来。没有它,转录文本里每句话都对,但你不知道是谁许下承诺、谁提出反对。搜索、摘要、待办事项提取、语音助手记忆都会因此变得不可靠。

NVIDIA这次把模型权重开放,参数量 100M,支持最多 8 个说话人,同时覆盖离线录音和流式实时场景。在VoiceArena首批Diarization-Bench的 139 段英语对话(约 22 小时)上,它以 14.72% 的DER排第一,第二名是 19.3%。

真正值得看的是效率数字。在 30.4 秒输入缓冲配置下,RTFx从上一代的 2,619× 提升到 15,113×,同时DIHARD III的DER从 19.09% 降到 12.73%。这不是单流端到端延迟,而是批量吞吐,别被数字吓到或骗到。

限制也得说清楚:它输出的是speaker_0、speaker_1这类匿名通道,不是真实身份;超过 8 人的场景不在支持范围内;VoiceArena的初始结果还可能随完整版评估变化。适合做会议转录、客服分析、多说话人ASR管线的团队先拿自己的音频测一把。

NVIDIA在Hugging Face博客发布了Nemotron 3 Diarization,一个开放权重的说话人日志(speaker diarization)模型。模型参数量 1 亿,支持最多 8 个说话人,可同时用于实时流式和离线录音场景。

在VoiceArena首批Diarization-Bench结果中,该模型在 12 个系统、共 17 种配置中排名第一。评测覆盖 139 段英语对话、总计约 22 小时,开启重叠语音计分、系统自带语音活动检测、不使用边界容差,最终DER为 14.72%。排名第二的系统DER为 19.3%,相对降低约 24%。

该模型也使用 100 毫秒和 250 毫秒边界容差排名第一,并在面对面录音和在线录音两类场景中均排名第一。NVIDIA说明,这些是初始结果,VoiceArena完整版评估及配对统计分析完成后可能发生变化。

模型如何进行流式说话人日志

说话人日志要解决两个问题:检测语音并分配给正确的说话人;在静音、打断或长时间间隔后仍保持分配一致。流式场景更难,因为系统每次只收到一小段新音频和有限上下文。

Nemotron 3 Diarization沿用Sortformer的做法,按说话人首次出现的顺序排列输出通道。第一个新声音进入第一个说话人通道,下一个新声音进入第二个通道,以此类推。这种按到达时间排序的方式让通用说话人标签保持稳定,无需为每个音频块重新求解说话人排列。

模型接受 16 kHz单声道音频,转换为 10 毫秒帧步长的梅尔频谱图特征,再以 8 倍堆叠生成 80 毫秒帧,送入带旋转位置嵌入(RoPE)的 31 层Transformer编码器。Transformer之上是一个Conv1D层,将预测上采样至输入特征分辨率。默认输出为 [T, 8] 浮点张量:T个时间步乘以 8 个可能的说话人通道,每个值是该时刻说话人活跃的概率。

流式推理期间使用两种记忆机制提供上下文:到达顺序说话人缓存(AOSC)保留先前音频块中观察到的说话人信息,按到达顺序通道组织;先进先出(FIFO)队列提供当前块之前的近期帧上下文。输入缓冲区还包含右上下文,即当前音频块之后的音频。右上下文越多越有助于判断说话人切换,越少则等待时间越短。

  • 输出为 [T, 8] 概率张量,默认步长 10 毫秒,可配置为 10 毫秒的其他倍数
  • 支持重叠语音:两人同时说话时,同一帧可有两个通道同时活跃
  • 后处理将概率转换为带起止时间戳的通用说话人标签
  • 支持分块推理,移除模型强制的最大音频时长限制
  • 在异常长录音或严重噪声、混响、远场采集、领域偏移的音频上性能仍可能下降

训练数据与基准结果

模型使用公开及授权语音数据训练,包括从David AI授权的多人标注真实对话。额外的授权David AI音频用于生成大规模模拟英语和多语言混合数据,覆盖 21 种语言。NVIDIA称,在训练中加入David AI数据后,复合DER在离线和超低延迟两种运行点上均下降 0.77 个百分点,从 11.19% 降至 10.42%。

在 1.04 秒输入缓冲延迟下,Nemotron 3 Diarization在全部 8 个评测条件上降低了DER,相对降幅从CALLHOME-Part2的 9.0% 到NOTSOFAR1 MHM的 65.2%,8 个数据集相对降幅的未加权平均为 41.0%。NVIDIA说明这是各评测条件相对改进的平均值,不是将所有录音合并计算的汇总DER。

在两模型共有的每个延迟配置(30.4、1.04 和 0.32 秒)下,新模型在每项评测数据集上的全套DER都低于基线。基线是NVIDIA此前的四说话人流式Sortformer模型diar_streaming_sortformer_4spk-v2.1。

说话人数更多的场景下优势扩大。在DIHARD III、CALLHOME-Part2和NOTSOFAR1的更高说话人数子集中,基准优势更明显。但NVIDIA也指出一个细节:在两人说话的CALLHOME子集上,新模型DER为 5.98%,略高于基线的 5.68%;而在CALLHOME-Part2完整评测中,DER从 10.32% 改善至 9.10%。

  • 评估包含 901 个条件特定录音,覆盖多语种电话语音、会议、近场与远场麦克风、多麦克风采集和困难声学环境
  • 每项评估都对重叠语音计分
  • DIHARD III、AliMeeting、AMI、NOTSOFAR1使用零秒容差;CALLHOME-Part2使用 0.25 秒容差
  • 结果由NeMo e2e_diarize_speech.py评估脚本生成
  • DIHARD III将 5 至 9 人录音合并为一组结果,其中 9 人超过模型的 8 人上限,该汇总包含超出规格的音频

延迟、吞吐与推荐配置

同一个模型支持 30.4 秒、1.04 秒、0.64 秒和 0.32 秒的推荐输入缓冲延迟。更短的缓冲让系统更快响应,更多上下文通常改善准确率和吞吐量。这些数值衡量的是推理前缓冲的音频,计算、网络、ASR和应用处理会叠加到端到端延迟上。虽然模型技术上可使用 80 毫秒输入缓冲,但 0.32 秒是最低推荐配置。

在 30.4 秒配置下,模型在batch size 32、使用torch.compile() 时达到 15,113× RTFx,基线为 2,619×,同时DIHARD III DER从 19.09% 降至 12.73%。在 1.04 秒配置下,RTFx为 865×,基线为 136×,DER从 19.60% 降至 13.18%。RTFx计算方式为总音频时长除以总处理时间。

NVIDIA说明这些数字测量的是在披露的测试系统上的批量吞吐,不应被解读为单流、端到端应用延迟。开发者应在目标硬件上对完整管线进行基准测试,包括数据移动、说话人日志、ASR和下游处理。测试使用BF16、NeMo PyTorch后端、NVIDIA RTX PRO 5000。

  • 默认DER指标由三部分组成:漏检语音、误报语音和说话人混淆,三项相加后除以参考说话人总时间
  • 重叠的参考说话人各自计入分母
  • 基准设置会显著影响DER,因此评估协议是结果的一部分
  • 说话人日志与说话人归因ASR是不同任务:前者输出说话人活跃区间和时间戳,后者输出文本
  • 应用应分别评估两个组件以及组合管线在目标音频上的表现

Argmax SDK与上手方式

Argmax已在Argmax Pro SDK 3中加入对Nemotron 3 Diarization的支持,为最多 8 人的对话提供实时说话人归因,并推出预先进行说话人日志的转录API,在语音识别前分离说话人,旨在改善重叠语音的复杂对话转录。Argmax用OpenBench对 6 个说话人日志系统在 11 个数据集上进行了基准测试,NVIDIA称Nemotron 3 Diarization在所有 6 个系统中错误率最低,并在 11 个数据集中的 5 个上得分最低,尽管存在最多 8 人的限制。Argmax的Atila Orhon称,相比前代Sortformer v2.1,错误率降低了 60%。

模型支持 16 kHz单声道 .wav、.flac、.opus和 .mp3音频,设计用于搭载受支持NVIDIA Ampere、Hopper或Blackwell GPU的Linux系统。使用需Python 3.12或更高版本、Cython和较新PyTorch,通过uv安装系统包和nemo-toolkit[asr]。

离线推理示例加载nvidia/Nemotron-3-Diarization检查点,使用推荐的 30.4 秒配置,参数以 80 毫秒帧为单位:spkcache_len=264、fifo_len=40、chunk_len=340、chunk_right_context=40、spkcache_update_period=300。diarize() 方法返回形如start_seconds end_seconds speaker_id的字符串段,同一说话人可出现在多个段中,区间不必互斥。API接受音频路径、路径列表、NumPy数组或按行分隔的JSON清单。

  • Nemotron 3 Diarization提供匿名说话人通道和通用标签及时间戳,不进行身份验证
  • 下游应用可通过时间戳结合会议元数据、用户画像或活跃说话人验证模型,将通道ID映射到具体身份
  • 模型最多支持 8 个说话人通道
  • NVIDIA提供在线演示,包含合成对话、8 人模式、实时麦克风输入和压力测试场景
  • 演示中用预置场景,部分 8 人场景提供简短的说话人上下文铺垫;这些说明该上下文下的行为,不是无铺垫基准测试

信息来源

Hugging Face Blog原始来源