研究Apple Machine Learning Research·原文 2026年10月2日本站收录 2026年10月3日

苹果研究:强化语言辨别能力可缩小多语言语音模型与单语言模型的差距

苹果机器学习研究团队在受控英语/法语HuBERT设置中发现,通过在预训练中强化模型的语言辨别能力,双语模型在连续音素辨别和更高层语言指标上缩小了与单语言模型的差距,部分指标实现反超。

AI解读:多语言自监督语音模型可以跨语言共享信息,但在相同的总预训练数据预算下,它们通常仍然不如单语言模型。苹果研究团队想知道:这个差距是不是因为模型没有把“这是哪种语言”这件事学清楚?

他们用英语/法语HuBERT做了两个干预:加一个辅助语言分类器,以及按语言分别做k-means聚类目标。两种方法都逼着模型在预训练时更主动地区分语言,结果双语模型的表现更接近甚至局部超过单语言模型。

具体数字上,音素辨别错误率从双语基线的 11.6% 降到 10.4%,单语言模型是 10.8%;词汇任务从 52.1% 升到 56.7%,单语言是 58.5%;韵律任务从 68.9% 升到 72.9%,单语言是 72.6%。

研究还发现,干预时机很重要:在训练第一阶段就引入语言辨别,大多数指标的提升最大;后期或反复干预效果更小,而且语言之间的隔离会加剧。

对做多语言语音系统的人来说,这意味着不用额外数据,只调整预训练目标就可能改善多语言模型的单语言表现。但结论目前只来自英语/法语一对语言的受控实验,其他语言组合和更大规模场景还需验证。

苹果机器学习研究团队发布的研究显示,多语言自监督语音模型在总预训练数据预算相同的情况下仍落后于单语言模型,而强化模型在预训练期间的语言辨别能力,可以缩小这一差距。该研究使用受控的英语/法语HuBERT设置,测试了两种干预方法:辅助语言分类器和按语言分别执行的k-means目标。

研究给出的具体数字是:连续特征音素辨别错误率(phone-ABX,越低越好)从双语基线的 11.6% 降至 10.4%,单语言模型为 10.8%;词汇表现(sWUGGY,越高越好)从 52.1% 提升至 56.7%,单语言模型为 58.5%;韵律表现(ProsAudit词汇子任务,越高越好)从 68.9% 提升至 72.9%,单语言模型为 72.6%。

研究还观察了HuBERT不同训练阶段的效果:大多数语言指标的最大提升出现在第一轮迭代就引入语言辨别时,而更晚或重复的干预带来的改善较小,并伴随语言间隔离程度的增加。

作者总结称,这些结果支持语言辨别在降低多语言学习额外成本中具有因果作用。论文作者为Maureen de Seyssel、Jie Chi(共同贡献)和Zakaria Aldeneh(共同贡献)。

信息来源