Google发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款语音模型
Google推出面向创意配音与高吞吐音频生产的两款TTS模型,提供超2000种预置音色,覆盖100多种语言,Hume AI基准测试中Flash TTS综合得分71.4,口音建模60.8。
AI解读:Google这次把语音合成拆成两条产品线:Flash TTS负责需要精细调控的创意配音,Flash-Lite TTS负责大规模、按成本计算的自动化音频生产。这个划分意味着游戏、有声书团队和客服、翻译流水线可以各取所需,不必再用同一套模型硬扛所有场景。
技术上的核心变化是音色库从过去固定的30种扩展到超过2000种预置人声,覆盖魁北克法语、苏格兰英语、墨西哥西班牙语等区域变体,语言超过100种。对需要本地化口音的团队来说,这减少了自行微调或寻找配音演员的环节。
在Hume AI的第三方基准测试中,Flash TTS综合得分71.4,口音建模60.8,并在整体质量指数中排第一,Flash-Lite TTS排第二。Voice Arena的双盲人耳测试也显示其在日语、巴西葡萄牙语、越南语等区域语言上更受偏好。这些是单项评测结果,不等于在所有语种和场景中都占优。
音频生产方面的能力包括:单个脚本可驱动双人对话并保持自然轮替与声音分离,多小时的音频文件中音质和音色保持稳定,编剧可以在文本中插入停顿、呼吸等非语言标记以及|mhm|、|yeah|等反应词来调节对话节奏。这些功能直接对应有声书录制和播客制作中常见的音质退化问题。
安全方面,声音克隆需要原始声音所有者录制30秒参考音频并附一段明确的口头同意录音,Google会验证两段音频的声学一致性后才处理自定义音色。导出的音频文件嵌入了SynthID不可感知水印和C2PA来源元数据,下游检测工具可以识别合成语音。
开发者可以通过Google AI Studio和标准Gemini API调用两款模型,并接入Agora、LiveKit、Pipecat、Vercel等框架。早期商业集成包括Figma、HeyGen、Linguana、Wondercraft、99.co和Ollang。
终端用户可在Gemini Notebook中使用Flash TTS,Google Vids则集成了Flash-Lite TTS;Gemini Enterprise客户将在后续部署中获得管理API访问权限。
Google发布了两款Gemini 3.8 Flash TTS语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。据AI News报道,两款模型将语音合成任务拆分为创意方向与成本管理两条路线。
Gemini 3.8 Flash TTS面向互动娱乐、游戏开发和长篇旁白,工作室团队可通过提示词进行声音设计。Gemini 3.8 Flash-Lite TTS则面向自动化媒体配音、面向客户的对话代理和高吞吐翻译流水线。
两款模型扩展了Google此前的音频产品线,此前已推出3.5 Live Translate、3.5 Transcribe、3.8 Live和3.8 Live Extended Thinking。新模型被设计用来取代过去固定的30种旧音色目录。
开发者现在可以访问超过2000种预置人声档案,覆盖魁北克法语、苏格兰英语、墨西哥西班牙语等区域语言变体,涉及100多种语言。一个即将推出的声音混音模块将允许音频工程师通过直接文本命令调整音色、音高、语速和口音轮廓。
在第三方评测中,较大的模型在Hume AI语音设计基准上综合得分为71.4,口音建模得分60.8,为该类别领先;在Hume AI整体质量指数中,Gemini 3.8 Flash TTS排名第一,Gemini 3.8 Flash-Lite TTS排名第二,均超过Gemini 3.1 Flash TTS此前建立的基线。Voice Arena的双盲人耳测试确认其在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等区域语言上具有偏好优势。
多说话人编排和长时间合成是重点方向:单个脚本可驱动双人对话,在长时间对话中保持自然的轮流发言和声音分离;音频质量与角色音色在多小时文件中保持稳定,减少有声书录制和系列播客中的声音退化。编剧可在制作文本中直接插入非语言声学标记,如停顿、呼吸等标签,以及|mhm|、|yeah|等反应性口语插入词来调节对话节奏。
声音克隆需30秒参考录音加口头同意,导出音频嵌入SynthID与C2PA
声音克隆流程依赖强制身份检查以应对冒充风险。重建声音档案需要一段30秒的参考录音,并附上由原始声音所有者朗读的明确口头同意录音。Google在处理自定义档案前会验证两段音频之间的声学一致性。
生成的音频文件会直接在导出的波形中嵌入不可感知的SynthID音频水印和加密的C2PA来源元数据,确保下游检测工具能够识别合成语音素材。
开发者可通过AI Studio与Gemini API调用,Figma、HeyGen等已集成
企业环境中的部署已在多个软件生态中启动。软件开发者可通过Google AI Studio和标准Gemini API访问Flash TTS与Flash-Lite TTS,并可连接Agora、LiveKit、Pipecat和Vercel运行的开发者框架。
早期商业集成涵盖Figma、HeyGen、Linguana、Wondercraft、99.co和Ollang,用于区域媒体翻译和客户服务自动化。终端用户可在Gemini Notebook中直接使用Flash TTS,Google Vids则集成了Flash-Lite TTS。Gemini Enterprise客户将在即将到来的部署批次中获得管理API访问权限。