Hugging Face Transformers 5.18.0新增Nemotron 3说话人分离等四个模型
Nemotron 3 Diarization支持流式与离线说话人分离,最多处理 8 人;NemotronH Omni把文本、图像、视频和声音放进同一个自回归模型。
AI解读:这次发布的实际内容是四个新模型的接入:Nemotron 3 Diarization做说话人分离,NemotronH Omni做文本图像视频声音的多模态推理,HyperCLOVAX Vision V2是NAVER的多模态视觉语言模型,GTE是文本检索用的编码器。对用Transformers跑推理或微调的人来说,这意味着这些权重不再需要自己写加载代码。
最值得看的是Nemotron 3 Diarization。它要回答的是“谁在什么时候说话”,支持流式和离线两种模式,最多 8 个说话人,输出顺序按每个说话人在音频中首次出现的时间排列。同一个checkpoint可以调延迟档位,从 80 毫秒输入缓冲到 30.4 秒的离线式缓冲;输出帧分辨率按 10 毫秒的倍数配置;分块推理时音频总时长没有上限。
需要做会议转录、播客分段或客服录音分析的人,以前往往要单独搭一套说话人日志流水线,现在可以直接用官方支持的模型。
另外三个模型面向不同场景。NemotronH Omni把NemotronH混合Mamba-Transformer语言模型、RADIO视觉编码器和可选的Parakeet声音编码器拼在一起,用单个自回归模型统一处理文本、图像、视频和声音。
HyperCLOVAX Vision V2由NAVER开发,语言主干是HyperClovaX,视觉编码器来自Qwen2.5-VL,支持文本、图像、视频输入,并用内置thinking token做思维链推理。
GTE是BERT风格的双向编码器,把绝对位置嵌入换成RoPE,用门控MLP,每个残差连接后做层归一化,同一架构支撑阿里的gte系列和Snowflake的snowflake-arctic-embed-m-v2.0。
这次版本同时列出了破坏性变更,包括ROCm下gpt-oss把FA3路由到aiter-flash-attn、DETR图像处理提速、indexers的layer_type重映射、vLLM后端视频token计数修复、DINO系列现代化,以及Kernels版本提升。依赖该版本的现有项目升级前需要核对这些改动是否影响自己的代码路径。以上信息依据的是发布说明摘要,未逐条核对每个PR的完整diff。
Hugging Face发布Transformers 5.18.0,新增四个模型:Nemotron 3 Diarization、NemotronH Omni、HyperCLOVAX Vision V2和GTE。
其中Nemotron 3 Diarization是开放权重的流式说话人分离模型,用于判断真实音频中“谁在什么时候说话”,同时支持流式和离线推理。
该版本还列出了多项破坏性变更,涉及ROCm上的gpt-oss、DETR图像处理、indexers的layer_type重映射等。
Nemotron 3 Diarization:最多 8 人、延迟从 80 毫秒到 30.4 秒
Nemotron 3 Diarization是开放权重的流式说话人分离模型,设计目标是确定真实音频中“谁在什么时候说话”。它支持流式和离线两种推理方式,最多处理 8 个说话人,并按每个说话人在输入音频中首次到达的顺序排列输出。
模型采用为Streaming Sortformer引入的Arrival-Order Speaker Cache(AOSC)和FIFO队列。单个checkpoint支持可配置的延迟档位,范围从 80 毫秒输入缓冲到 30.4 秒的离线式缓冲,输出帧分辨率可按 10 毫秒的倍数配置。使用分块推理时,最大音频时长不受限制。
该模型由 @eustlb通过PR #49056 加入,文档位于transformers的nemotron3_diarization模型页。
- 支持流式与离线推理
- 最多 8 个说话人
- 输出按说话人首次出现顺序排列
- 单checkpoint支持 80 毫秒至 30.4 秒的延迟档位
- 输出帧分辨率按 10 毫秒倍数配置
- 分块推理下音频时长不受限
NemotronH Omni:文本、图像、视频、声音统一推理
NemotronH Omni是NVIDIA的多模态推理模型,把NemotronH混合Mamba-Transformer语言模型与RADIO视觉编码器、可选的基于Parakeet的声音编码器组合在一起。
图像和视频patch通过RADIO tower和pixel-shuffle MLP投影到语言模型的嵌入空间,位置在对应的上下文token处;音频片段以同样方式投影到对应位置。最终得到的是一个在文本、图像、视频和声音上联合推理的单一自回归模型。
该模型由 @meatybobby通过PR #46509 加入支持,文档位于nemotron_h_omni模型页。
- 语言主干:NemotronH混合Mamba-Transformer
- 视觉编码器:RADIO
- 声音编码器:可选、基于Parakeet
- 图像与视频经RADIO tower和pixel-shuffle MLP投影
- 音频以同样方式投影
- 单一自回归模型联合推理四类输入
HyperCLOVAX Vision V2与GTE
HyperCLOVAX Vision V2是NAVER开发的多模态视觉语言模型,语言主干使用HyperClovaX,视觉编码器来自Qwen2.5-VL。模型支持文本、图像和视频输入,并通过内置的thinking token实现思维链推理。该模型由 @jp1924通过PR #44314 加入。
GTE出自论文《mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval》,作者包括Xin Zhang、Yanzhao Zhang、Dingkun Long、Wen Xie、Ziqi Dai、Jialong Tang、Huan Lin、Baosong Yang、Pengjun Xie、Fei Huang、Meishan Zhang、Wenjie Li和Min Zhang。
GTE是BERT风格的双向编码器,用RoPE替换绝对位置嵌入,采用门控MLP,并在每个残差连接后做层归一化。同一架构支撑阿里的gte-*-v1.5、gte-multilingual-*、gte-en-mlm-* 检查点,以及Snowflake的snowflake-arctic-embed-m-v2.0。该模型由 @harshaljanjani通过PR #48416 加入。
- HyperCLOVAX Vision V2:NAVER开发,HyperClovaX + Qwen2.5-VL
- HyperCLOVAX Vision V2支持文本、图像、视频和thinking token思维链
- GTE:RoPE替换绝对位置嵌入,门控MLP,残差后层归一化
- GTE架构同时支撑阿里gte系列与Snowflake snowflake-arctic-embed-m-v2.0
破坏性变更与修复
发布说明列出的破坏性变更包括:ROCm下gpt-oss将FA3路由到aiter-flash-attn并生成ROCm fixtures(PR #46837);DETR图像处理提速(PR #48066);indexers的layer_type重映射(PR #48974);vLLM中Transformers后端视频输入的video token计数修复第一部分(PR #48894);DINO系列现代化(PR #46266);Kernels版本提升(PR #48714)。
此外还有大量缺陷修复与改进,例如修复hub tokenizer类、GLM 5.3 Flash保存文本检查点时保留原始名称、为MoE的GGUF集成增加支持、修复AutoImageProcessor在只安装Pillow时仍要求torchvision、修复Qwen2.5-VL分数视频间隔的时间RoPE、以及将huggingface_hub上限提升到 <3.0 等。
- ROCm gpt-oss将FA3路由至aiter-flash-attn
- DETR图像处理提速
- indexers layer_type重映射
- vLLM视频token计数修复(第一部分)
- DINO系列现代化
- Kernels版本提升
- 其余为缺陷修复与改进,详见PR列表
依据说明
以上内容整理自Transformers 5.18.0发布说明及其摘要,未逐条核对每个PR的完整改动。用户如需评估升级影响,应查看对应PR与文档页面。