模型The Decoder AI·原文 2026年9月27日

Nvidia发布免费100M参数说话人分离模型Nemotron 3 Diarization

Nvidia推出约1亿参数的说话人分离模型Nemotron 3 Diarization,权重免费开放,最多可区分8位说话人并检测同时发言;在VoiceArena基准上以14.7%的DER领先,较前代Streaming Sortformer平均降低41%错误率。

AI解读:Nvidia发布了一个叫Nemotron 3 Diarization的模型,干的事很简单:在一段对话里判断此刻是谁在说话。权重免费开放,参数量约1亿,最多能分辨8个说话人,还能识别出多人同时开口的情况。

它可以直接配合像Parakeet这样的语音识别系统,生成带说话人标签的文字记录——但标签是匿名的,比如speaker_2,不会告诉你真实姓名。录音和实时音频都能处理。

文章汇总的测试数据显示,在VoiceArena Diarization Benchmark v1上它的DER为14.7%,比前代Streaming Sortformer平均降低41%错误率,目前在该榜排第一,领先第二名19.3%的水平。

限制也很明确:人更多、背景噪声大或混响强,错误率都会上升;音频缓冲越短,精度一般越差。所以它更适合说话人数量可控、录音质量过得去的场景。

需要留意的是,由于标签是匿名的,它只解决“谁在说”,不解决“说话的人是谁”。对做会议记录、播客转录的开发者来说,省掉的是人工标注说话人切换那一步。

Nvidia发布说话人分离模型Nemotron 3 Diarization,用于判断对话中特定时刻是哪位说话人在发言。该模型参数量约1亿,权重免费开放。

模型最多可区分8位说话人,并检测多人同时说话的情况。它与Parakeet等语音识别系统配合时,可生成带说话人标签的转录,但标签为匿名形式,如speaker_2。该模型同时支持录音和实时音频。

据The Decoder报道,在VoiceArena Diarization Benchmark v1中,Nemotron 3以14.7%的DER(说话人分离错误率)领先,比前代Streaming Sortformer改善41%。报道称该基准较严格:重叠语音计入错误,说话人切换处的微小错位也按错误计分。

同一报道显示,在VoiceArena的Diarization-Bench上,该模型当前以14.72%的错误率排第一,领先第二名系统的19.3%。在使用1.04秒缓冲区的条件下,相比Streaming Sortformer,新模型在8个测试场景中平均将错误率降低41%。

模型音频缓冲区可设为四档,范围从30.4秒到0.32秒。报道指出,缓冲区越短,准确率通常越低。

报道同时指出,参与者更多、背景噪声严重或存在混响时,模型的错误率会升高。该模型生成的说话人标签为匿名标签,不识别具体身份。

信息来源

The Decoder AI原始来源