谷歌发布Gemini 3.8 Live with Live Avatar,为对话模型加上实时数字人形象
该功能把近实时视频生成与语音对话耦合,在Gemini Enterprise中提供带唇形同步、表情和背景工具调用的虚拟形象,支持 97 种语言切换;自定义形象目前仅限企业白名单。
AI解读:谷歌给Gemini 3.8 Live加了一张会说会看的脸。9 月 24 日发布的Live Avatar把近实时视频生成和语音对话绑在一起,让企业智能体在说话时同步输出带唇形、表情和自然轮替的视频形象。它已在Gemini Enterprise上线,不只是给客服换了个虚拟头像,而是把视频和语音放在同一个实时回路里。
真正常用的功能可能藏在后台:Live Avatar支持异步工具调用,可以在对话继续的同时触发工具、拉取数据。谷歌举的例子是酒店入住登记——前台对话不中断,查信息这些动作在后台跑。对需要边聊边办业务的企业场景,这比“数字人好看”更关键。
面向全球部署时,语言往往是第一个卡点。谷歌称Live Avatar原生支持语音到语音的多语言同步,能在 97 种语言之间切换,唇形和表情随之调整,且不降低视频保真度、不产生视觉漂移。这个数字覆盖范围很广,但实际表现是否在每种语言上都一致,官方没有给出逐语言的评测数据。
品牌定制上,谷歌提供多种预设形象,也允许企业用一张高质量参考图生成保留本人或角色特征的动态形象;不过自定义形象目前仅通过企业白名单开放,不是所有客户都能直接用。
透明性方面,谷歌表示所有AI生成的音视频输出都会嵌入SynthID隐式水印,用于检测AI生成内容、减少误传和冒用。对要在客服、导览等场景使用虚拟形象的企业来说,这条和高管审批、合规流程直接相关。
如果你不在企业智能体这条线上,暂时不用做什么。真正需要评估的是准备在客服或交互导览中部署虚拟形象的企业:先确认自己在不在自定义形象白名单里,再多语言表现和工具调用的实际延迟要拿自己的场景测。
谷歌 9 月 24 日发布Gemini 3.8 Live with Live Avatar,为Gemini的对话式AI加入近实时视觉形象。该功能将实时对话能力与低延迟流式视频原生耦合,面向企业及其用户提供带唇形同步、自然表情和流畅轮替的对话体验。
Live Avatar已在Gemini Enterprise上线,谷歌同时提供API文档供开发者接入。发布方署名为Gemini Audio团队研究科学家Shuo-yiin Chang和软件工程师CJ Zheng。
异步工具调用让对话不中断
谷歌称Live Avatar由Gemini的推理能力支撑。通过异步工具调用,Live Avatar可以在继续对话的同时触发工具调用并在后台获取数据,从而在保持对话流程不中断的情况下处理复杂任务。
官方演示的例子是酒店入住登记:工具在后台被调用,而对话继续进行。
97 种语言间切换,唇形和表情动态适配
谷歌表示Live Avatar具备原生多语言语音到语音同步能力,其唇形同步和表情会动态适配,并可在 97 种语言之间无缝切换,同时不降低视频保真度、不引入视觉漂移。
官方演示展示了在对话中途切换语言、唇形与表情随之适配的效果。
自定义形象需企业白名单
除了一批多样化的预设形象,企业还可以定制Live Avatar。开发者可以基于一张高质量参考图生成完整动画、可响应的形象,同时保留参考对象的相貌、品牌风格或角色身份。
谷歌明确说明,自定义形象创建目前仅通过企业白名单开放。
音视频输出嵌入SynthID水印
谷歌称Live Avatar在设计上加入了严格的保护措施,以尊重身份并保持AI生成内容的透明性。所有由谷歌AI产品生成的输出都带有SynthID水印。
这种不可感知的水印直接编织进音频和视频输出中,用于帮助检测AI生成内容、减少错误信息和错误归属。谷歌建议查阅其模型卡了解完整的安全与负责任部署方案。