模型Google AI官方博客·原文 2026年9月16日

Google发布Gemini 3.8 Live与 3.5 Transcribe语音模型

Gemini 3.8 Live与 3.8 Live Extended Thinking支持边对话边执行任务,在Artificial Analysis语音到语音榜单排名第一;Gemini 3.5 Transcribe覆盖 85 种以上语言,流式转录平均词错率 4.0%。

AI解读:Google把语音模型从“能对话”推向“能边聊边干活”。Gemini 3.8 Live和 3.8 Live Extended Thinking可以在保持对话的同时执行任务,异步函数调用让API和工具调用在后台跑,音频回复继续往前流。对做语音客服、语音助手的开发者来说,这省掉了一层“先转文字、再调模型、再合成语音”的级联拼装。

价格是这次最实在的信息:音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元。Extended Thinking版本还支持可配置思考,复杂多步推理放在后台跑,同时能在主对话里回应或播报进度。Google称 3.8 Live Extended Thinking在Artificial Analysis语音到语音榜单排名第一,但这是厂商引用的第三方榜单成绩,只看单项排名,不代表所有场景都更好。

Gemini 3.5 Transcribe上个月发布,是专门的语音转文字模型,覆盖 85 种以上语言,平均词错率流式 4.0%、非流式 2.6%。它支持自动语码切换、最多 1000 条自定义词汇偏置,以及去掉口头语和自我更正的智能转录模式。做字幕、呼叫中心、实时音频分析的团队可以关注;没有公开的效果对比数据,所以别急着按WER数字推断具体产品能省多少人力。

Google于 2026 年 9 月 15 日通过Gemini API和Google AI Studio发布新的Gemini Live模型:Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking。同一天,Google也向开发者介绍了上个月已发布的专用语音转文字模型Gemini 3.5 Transcribe。

3.8 Live支持边对话边执行任务

根据Google AI官方博客,Gemini 3.8 Live是原生语音到语音模型,能够“在执行任务的同时保持对话”。3.8 Live Extended Thinking面向复杂请求提供更深的推理,Google称其在Artificial Analysis的语音到语音榜单上排名第一。

Google列出的关键能力包括:异步函数调用,在后台执行API和工具调用的同时继续向用户流式传输音频回复;视觉上下文,让对话基于实时视觉输入;字母数字精度,准确解析确认码、索赔编号和技术数据;多语言支持,覆盖 97 种以上语言并保持口音一致性;增量内容更新,把实时音频与结构化数据合并后返回结合上下文的回复。

Google表示,这些模型相比此前的live模型是一次“台阶式变化”,也是级联架构更精简的替代方案。3.8 Live与 3.8 Live Extended Thinking均可通过Live API使用。

  • 音频输入定价为每分钟 0.005 美元,音频输出为每分钟 0.018 美元
  • 开发者也可通过Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel和Vision Agents访问模型
  • Google称这些集成合作伙伴负责媒体流基础设施,供实际部署使用
  • 3.8 Live Extended Thinking支持可配置思考,在后台处理复杂多步推理,同时可在主对话中回应或播报进度

3.5 Transcribe:85 种以上语言,流式WER 4.0%

Gemini 3.5 Transcribe是Google上个月发布的专用语音转文字模型,主打低延迟、高精度转录。Google称其平均词错率在流式场景为 4.0%,非流式场景为 2.6%,覆盖 85 种以上语言。

该模型支持自动语码切换,能够处理句子内部和句子之间的语码与语言切换,无需手动配置;支持自定义词汇偏置,通过传入最多 1000 条术语的custom_vocabulary列表,引导识别模型偏向领域术语、生僻行话、公司名和专有名词;还提供智能转录模式,输出带结构化格式、自我更正并去除口头语(disfluency)的整理后文本。

Google表示,3.5 Transcribe可用于语音体验,也适用于亚秒级字幕、呼叫中心代理和实时音频分析等无状态任务。开发者还可以通过Interactions API转录最长 1 小时的音频文件,并获得结构化时间戳和说话人分离。

  • 流式平均WER 4.0%,非流式平均WER 2.6%
  • 支持 85 种以上语言
  • 自定义词汇列表上限 1000 条术语
  • Interactions API支持最长 1 小时音频、结构化时间戳和说话人分离

Google音频模型套件与上手方式

Google在博客中列出了其面向开发者的完整音频套件:Gemini 3.5 Live Translate支持 70 种以上语言的语音到语音翻译;Gemini 3.1 Flash TTS提供高度可配置的语音生成,Google称更多更新即将推出;Lyria 3.5用于生产级音乐生成。这些模型均可在Gemini API中使用。

开发者可以在ai.studio/live试用模型,从GitHub克隆示例应用,或为代理配置live api skill。

信息来源