Google称其语言技术已覆盖 300 多种语言,Gemini 3.5实时翻译支持 70 种语言
Google AI官方博客披露:Universal Speech Model用 1200 万小时音频训练,TranslateGemma可离线运行,SL2T手语转文本首发支持ASL转英语。
AI解读:Google说它的技术和产品现在支持 300 多种语言的日常交互,覆盖 70 多亿人、占全球人口 86%。这是官方博客给出的口径。真正值得注意的不是这个数字本身,而是它接下来要做的事:让AI处理人们真实说话的样子,包括笑、抢话、犹豫,以及一句话里混着两种语言。
过去语音识别基本是“先转成文字、再处理文字、再合成语音”的流水线,语气、节奏、情绪全在这一步被扔掉。Google的做法是训练Gemini直接处理音频。落到产品上,Gemini 3.5 Live Translate做 70 种语言、2000 多个语言对的实时口译,并声称能自然处理中英夹杂这类切换;Gemini 3.5 Transcribe则用在Android Gboard的Rambler功能里,负责删口水词、修语法标点。
对非主流语言的使用者来说,数据是卡点。Google的应对是本地化合作:WAXAL覆盖 27 种撒哈拉以南非洲语言,Project Vaani已收集 109 种语言、超过 3 万小时语音,来自 15.5 万多名说话者;Amplify Initiative联合 1600 多名本地专家和 20 所大学贡献了 1.5 万个多模态数据点。
刚发布的Language Explorer工具可视化的LinguaMeta号称覆盖 7000 多种口语、书面和手语。
适用条件也比宣传语更具体。Google称全球仍有 30 多亿人没有可靠网络,于是推出TranslateGemma——一套基于Gemini、覆盖 55 种语言的轻量开源翻译模型,可端上运行,离线也能翻译。
对还在用功能机的人,Google支持Viamo的语音助手AVA,在卢旺达试点,用Gemini回答了 200 多万个问题。无障碍方面,SL2T训练涵盖 50 多种手语,在Pixel 11的Gboard和Live Transcribe上支持手语转文字,首批是ASL转英语。
这些功能多数还没有公开的独立效果数据,语言覆盖广不等于每种语言的翻译质量都一致——低资源语言恰恰是模型最容易出错的地方。真正受影响的是两类人:母语不在主流语种里的用户,以及需要离线或低带宽环境的人。其他人暂时不用做什么。
Google AI官方博客发布文章,介绍其在多语言AI上的进展。文章称Google的技术和产品目前支持 300 多种语言的日常交互,覆盖 70 多亿人,占全球人口 86%;Google Translate从 2006 年推出时只有少数语言,扩展到今天的 250 多种。
文章的核心主张是转向“原生音频智能”:不再先把语音转成文字再处理,而是训练Gemini这类模型直接处理音频,同时理解声音和意图,以保留语气、节奏、情绪和上下文。文章称人们说话并不总是完整语法句,会笑、会抢话、会犹豫,也会在一句话里混用多种语言,比如Spanglish或Hinglish。
Gemini 3.5 Live Translate覆盖 70 种语言,Transcribe接入Gboard
Google在文中列出两项面向实时对话的语音能力。Gemini 3.5 Live Translate支持 70 种语言的实时口语翻译、2000 多个语言对,并称能自然捕捉语码转换和情绪线索。Gemini 3.5 Transcribe被描述为Google迄今最精确的语音转文字模型,可把原始音频转成格式化文本,在嘈杂环境或复杂术语场景下也能工作。
Transcribe还驱动Android Gboard上的Rambler功能:删除填充词、修正语法和标点,并允许用语音指令编辑或改写、在不同语言间无缝切换。
- Gemini 3.5 Live Translate:70 种语言、2000+ 语言对实时口语翻译
- Gemini 3.5 Transcribe:Google称其为最精确的语音转文字模型,支持嘈杂环境和复杂术语
- Rambler集成在Android Gboard:删填充词、修语法标点、语音指令编辑、跨语言切换
1,000 种语言目标与 1200 万小时音频训练的Universal Speech Model
Google的“1,000 Languages Initiative”目标覆盖全球使用人数最多的 1000 种语言。文章称,为支撑这一目标,Universal Speech Model使用 1200 万小时音频训练,并采用跨语言迁移学习,把数据丰富语言中学到的模式迁移到训练数据稀少的语言上,以改善这些语言的语音理解。
文章称这项工作建立在 25 年公开研究和 400 多篇同行评审语音论文的基础上。
- 目标:支持全球使用人数最多的 1000 种语言
- Universal Speech Model训练数据:1200 万小时音频
- 方法:跨语言迁移学习,从高资源语言迁移到低资源语言
- 背景:25 年公开研究、400 多篇同行评审语音论文
WAXAL、Project Vaani、Amplify Initiative:本地化数据合作
文章称,由于网络内容过度偏向少数主流语言,教AI理解代表性不足的语言需要重新设计数据采集方式,方案是与本地草根伙伴合作。文章列出三个开放数据合作项目。
WAXAL在沃洛夫语中意为“说话”,发音为“Wah-hal”,与Makerere University、Digital Umuganda等伙伴共建,是覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,涉及 26 个以上国家、超过 1 亿使用者,记录传统数据集常缺失的声调变化和对话节奏。
Project Vaani与印度科学研究所(IISc)和Bhashini合作,采用以地区而非语言为锚点的方式绘制印度语言多样性,迄今收集 109 种语言、超过 3 万小时语音,来自 15.5 万多名说话者。Amplify Initiative与四大洲 1600 多名本地专家和 20 所大学合作,包括巴西UFMG、印度IIT Kharagpur和乌干达Makerere University,贡献了 1.5 万个捕捉本地细微差别的多模态数据点。
Google还推出Language Explorer,一个可视化LinguaMeta的交互工具。文章称LinguaMeta是全球最大的开源语言数据仓库,持续绘制 7000 多种口语、书面和手语,并称该工具获得Fast Company设计创新认可。
- WAXAL:27 种撒哈拉以南非洲语言,26+ 国家,超 1 亿使用者
- Project Vaani:109 种语言,3 万+ 小时语音,15.5 万+ 说话者
- Amplify Initiative:1600+ 本地专家、20 所大学、1.5 万条多模态数据
- Language Explorer:可视化LinguaMeta,覆盖 7000+ 语言
TranslateGemma离线翻译与功能机上的AVA
文章称全球仍有 30 多亿人无法获得可靠互联网接入,技术只有在人们实际生活的环境中可用才算真正可及。为此Google开发TranslateGemma,一套基于Gemini构建、覆盖 55 种语言的轻量开源翻译模型,可在端上高效运行,高质量翻译不再依赖云端或互联网连接。
对于低资源地区仍在使用的数百万功能机用户,Google支持Viamo的语音AI助手“Ask Viamo Anything”(AVA),把Gemini能力带到标准功能机上。文章称Viamo已在卢旺达面向其现有交互式语音应答用户完成AVA试点,该服务已用Gemini回答超过 200 万个问题。
- TranslateGemma:基于Gemini,55 种语言,轻量开源,可端上离线运行
- 适用条件:全球 30 多亿人缺乏可靠网络接入
- AVA:Viamo功能机语音AI助手,卢旺达试点,已用Gemini回答 200 万+ 问题
Pixel 11上的手语转文字与毛利语地名发音
Google称常规语音工具经常对非标准语音失效,使用者不得不迁就技术。其无障碍设计案例是Sign Language-to-Text(SL2T),训练覆盖 50 多种手语,在Pixel 11的Gboard和Live Transcribe上支持手语转文字听写,首批支持American Sign Language(ASL)转英语。文章称为全球 7000 万依赖手语交流的人提升可及性,这是重要的第一步。
在地名发音上,Google称在新西兰与毛利语专家合作,改进Google Maps中的地名发音。文章称把符合文化习惯的发音直接纳入文本转语音模型,确保技术反映所服务社区的语言和传统。
- SL2T:训练覆盖 50+ 手语,Pixel 11的Gboard和Live Transcribe支持手语转文字,首批ASL转英语
- 受众:全球 7000 万依赖手语交流的人
- Google Maps:与新西兰毛利语专家合作改进地名发音
规模数据:五大平台覆盖超 50 亿人
文章称,Google的语言技术已嵌入其核心生态,通过九个平台连接超过 50 亿人,包括Search、Android、Chrome、YouTube和Google Play。文章强调规模只是一部分,更大的目标是深度和丰富度:构建能理解上下文、尊重文化、容纳多种沟通方式的系统。
- 语言技术嵌入九大平台,覆盖超 50 亿人
- 列举平台:Search、Android、Chrome、YouTube、Google Play