Google发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款语音生成模型
两款模型均于 9 月 23 日起在Gemini API和Google AI Studio上线,Flash TTS主打角色语音创作与逐行导演控制,Flash-Lite TTS面向高吞吐、低成本场景。
AI解读:Google把文本转语音从“挑一个预设音色”改成了“开一间配音工作室”。新发布的Gemini 3.8 Flash TTS可以用自然语言提示从零创造角色声音,Flash-Lite TTS则负责批量配音和语音代理这类量大、要便宜的场景。
真正会受影响的是做游戏、有声书、播客、配音本地化和语音客服的团队。以前换一个角色音色、调整一句台词的情绪,往往要在多套工具之间来回倒腾;现在Google把音色设计、双人对话编排、逐行表演控制放进了同一个流程,并在Google AI Studio提供了一个语音设计工作区。
边界也很清楚:语音复制需要声音所有者本人录一段同意声明并通过验证,所有生成音频都会嵌入SynthID水印。这意味着克隆别人的声音不是填个API key就能干的事,合规环节被前置到了创建阶段。
Google于 9 月 23 日发布两款文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。Google称这是其迄今最具表现力的音频生成模型。
两款模型即日起在Gemini API和Google AI Studio面向开发者推出;企业版将通过Gemini Enterprise的API提供,Google称“即将推出”;面向普通用户,Flash TTS进入Gemini Notebook,Flash-Lite TTS进入Google Vids。
据Google介绍,新模型把语音生成从静态预设变为动态创作工作室,可用于Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook和Google Vids。公告由Gemini Audio团队的产品群经理Leland Rechis和研究科学总监Alan Cowen联名发布。
Flash TTS做角色声音,Flash-Lite TTS做批量配音
Google将两款模型按用途区分。Gemini 3.8 Flash TTS面向深度创作指导和角色设计,可用自然语言提示从零创造全新声音,适用于游戏、沉浸式有声书、播客和互动媒体;支持逐行指导表演,对表演提示、节奏、口音切换和反馈性应答进行细粒度控制。
Gemini 3.8 Flash-Lite TTS面向高吞吐、低成本规模化的场景,针对大批量配音、音频内容创作和富有表现力的语音代理做了优化,可对语调、节奏和表达细节做精细控制。
Google称这两款模型补充了其快速增长的Gemini Audio家族,此前已有 3.5 Live Translate、3.5 Transcribe、3.8 Live和 3.8 Live Extended Thinking。
从 30 个原始音色扩展到 2000+ 音色库
Google表示,Flash TTS可把音色从 30 个原始声音扩展到“无限音色库”,让开发者与企业构建自定义音频体验。
生成式音色设计方面,Gemini 3.8 Flash TTS支持通过自然语言提示定制角色、口音和声音特征,覆盖 100 多种语言和方言。
音色库方面,提供 2,000 多个可直接用于生产的音色,覆盖范围较广,包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
音色复制方面,只需一段 30 秒的音频样本,即可重建一致的声音特征,可用于本人声音或拥有使用权的声音;该功能由内置的同意验证、SynthID水印和C2PA凭证支撑,Google称这既保护开发者,也保护配音人才。
已保存的自定义声音可跨持续项目复用,Google称可保证一致表现并把音色漂移降到最低。
语音重混功能“即将推出”:用户可从音色库中挑选声音,微调音色、音高、语速和口音,并用提示调整特征,例如“加入一点美国南部口音”或“让表达更柔和”。
逐行导演、长篇生成与双人对话编排
选定音色后,两款模型都可对每一句台词的呈现方式做精细控制。
逐行指导表演:用户可以自己写舞台指示,也可以让Gemini依据自然脚本提示来引导表演,例如从平静的客服人员切换到低语的悬疑场景。
长篇生成:可在数小时的连续音频中保持高音质、自然节奏和角色音色,说话人漂移极小,Google称适用于播客和有声书。
原生双人场景编排:可从单一脚本直接指导多轮对话,用于播客或戏剧化叙事,同时保持两个声音清晰分离,并实现自然的对话轮替。
脚本化声音爆发与反馈性应答:可加入非语言提示(如笑声、叹息)和主动倾听的插入语(如“嗯哼”或“对”),用于精确控制喜剧节奏和反应节拍。
Hume AI基准排名与多语言盲测表现
Google称Gemini 3.8 Flash TTS在Hume AI的Voice Design Benchmark上以 71.4 分位居综合第一,在口音建模上以 60.8 分领先。
两款模型在Hume AI的Overall Quality Index上分别获得第一和第二名。Google表示,相比Gemini 3.1 Flash TTS,新模型在长篇内容和双人剧本控制等用例上有明显改进。
在Voice Arena的盲测人类偏好评估中,Gemini 3.8 Flash和Flash-Lite TTS在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等关键全球语言中位次靠前。
Google称这些模型支持 100 多种语言。
同意验证、SynthID水印与生态合作
Google表示,其声音创建与复制能力配有严格保障措施,以保护配音人才、尊重身份并确保内容透明。
语音复制需要同意验证:用户必须提供声音所有者本人的口头同意录音,且与参考说话人匹配,之后才能创建该声音。
更广泛地说,所有由Gemini Audio模型生成的音频片段都会嵌入SynthID水印。Google称这一不可感知的水印直接织入音频输出,使AI生成语音可被检测,以帮助防止虚假信息。
开发者可通过Gemini API在Agora、LiveKit、Pipecat、Vercel等平台上构建和部署语音生成体验。Google表示正与Figma、HeyGen、Linguana、Wondercraft、99.co和Ollang等公司合作,这些公司正在集成其最新TTS模型,用于加速全球配音、以细致的地区口音本地化媒体,以及规模化驱动对话式语音代理。