Google发布Gemini 3.8 Live与 3.8 Live Extended Thinking语音模型
两款面向语音智能体的实时对话模型开始推送,Extended Thinking在Artificial Analysis语音到语音质量指数得 82.6 分排第一,τ-Voice任务完成率 68.6%。
AI解读:Google把语音对话模型再往前推了一步:3.8 Live主打低成本、可规模化的实时对话,3.8 Live Extended Thinking主打复杂任务的边推理边说话。对做语音客服、语音助手的开发者来说,这是可以直接接进产品的底层能力,而不是演示视频。
真正值得看的数字是 82.6 和 68.6%。前者是Extended Thinking在Artificial Analysis语音到语音质量指数上的分数,Google称其排名第一;后者是它在 τ-Voice这个智能体任务完成基准上的成功率。也就是说,语音模型被拉到了『能否真正替用户把事情办完』这个维度上比,而不是只比谁说话更像人。
实际使用上的区别在于等待。普通模式可以边聊边在后台调工具;Extended Thinking会在推理的同时用『让我查一下……』这类口头铺垫保持对话不断,并实时播报多步任务的进展。这对需要查订单、走流程、跨系统操作的语音场景有用,但Google没有给出延迟的具体数值,只能从『near real-time』这一表述判断。
限制也明确:两款模型都只在部分渠道开放,企业侧仍是私密预览,Workspace商业客户和Google AI订阅用户要再等。所有AI生成的音频都会嵌入SynthID水印,便于检测AI生成内容。
对普通用户来说不需要立刻做什么,语音对话会更顺、更少冷场是渐进的体验变化。对开发者和企业来说,判断依据应该是自己场景下的任务完成率和成本,而不是榜单名次。
Google于 9 月 15 日发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时对话模型,称其为目前最先进的实时对话模型,在智能水平和并行推理上有重大升级,可让用户用语音执行复杂任务。
Gemini 3.8 Live面向规模和成本效率,结合对话智能、流畅对话和视觉接地能力;Gemini 3.8 Live Extended Thinking面向高复杂度任务,具备更高的智能水平和多步推理能力。Google表示,这两款模型为开发者和企业提供了构建可靠、可投入生产的语音智能体的基础模块,同时让Gemini应用、Google Workspace和Search中的语音交互更流畅。
Extended Thinking在语音到语音质量指数得 82.6 分,τ-Voice完成率 68.6%
Google称,Gemini 3.8 Live Extended Thinking在Artificial Analysis的语音到语音质量指数(Speech to Speech Quality Index)上以 82.6 分位列总榜第一;在智能体任务完成方面,τ-Voice得分为 68.6%,Sierra的 τ-Voice-banking基准得分为 35.1%。该模型在Big Bench Audio上得分为 97.7%,同时Google称其价格相对其他前沿模型仍具竞争力。
Gemini 3.8 Live在Speech Agent Arena中排名第二,Google称其在用户中偏好度较高,同时保持较高的成本效益。在ServiceNow用于评估语音智能体的EVA-Bench上,Google称这两款模型在复杂工作流中推动了帕累托前沿,在准确率与对话质量之间取得平衡。Google注明该测试运行在Gemini Enterprise Agent Platform的Live API上。
3.8 Live支持 97 种语言中途切换,后台调工具不影响对话
Gemini 3.8 Live可近实时处理视觉输入,为对话补充上下文;能在对话中途自动检测并切换 97 种受支持的语言;在继续对话的同时在后台执行工具和API调用,因此模型可以先确认请求、继续聊天,任务在后台完成。
对于需要更深推理的任务,3.8 Live Extended Thinking边推理边说话,在维持不中断对话流的同时提升复杂工作流的智能水平。它会用『让我查一下……』这类早期口头提示自然地确认用户请求,并通过实时进展播报引导用户了解多步后台任务的推进情况。
Google Workspace和Search中的语音体验
Google表示,Live模型在Google Workspace和Search中提供更直观、更协作的体验,尤其适合处理最复杂的任务。在Search Live中,Gemini 3.8 Live提供分步骤的实时故障排查帮助。
开发者平台与合作伙伴
通过Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vercel和Vision Agents等开发者平台让开发者能够构建和部署高性能语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,使开发者可以专注于用户体验设计。
Google还提到与Salesforce、Genspark和Lumeris等公司的合作,这些公司对 3.8 Live和 3.8 Live Extended Thinking在延迟、流畅度和工具调用能力方面的表现表示关注。
SynthID水印与推送范围
Google称其AI产品生成的所有音频都带有SynthID水印,这一不可感知的水印直接织入音频输出,确保AI生成内容可被检测,以帮助防止错误信息。
推送安排上,3.8 Live从发布当天开始推送:开发者可在Gemini API和Google AI Studio中使用;企业可在Gemini Enterprise私密预览中使用,稍后将登陆Gemini Enterprise for Customer Experience;所有用户可在Search Live中使用。
3.8 Live Extended Thinking同样从发布当天开始推送:开发者可在Gemini API和Google AI Studio中使用;企业可在Gemini Enterprise私密预览中使用,稍后将登陆Gemini Enterprise for Customer Experience和面向Google Workspace商业客户;所有用户可在Gemini Live中使用,Google AI Pro和Ultra订阅者可在Workspace的Docs中使用,所有Google AI订阅者可在Gmail和Keep中使用。