Simon Willison发布Gemini 3.8 TTS游乐场,支持自带API Key试听多角色对话
Google同日推出gemini-3.8-flash-tts与gemini-3.8-flash-lite-tts两款语音模型,提供超 2000 种声音;Willison用GPT-6 Astra随手写出一个可分享的测试界面。
AI解读:Google新发布的两款文本转语音模型自带 2000 多种声音,还能用一段 30 秒的录音克隆自定义音色。真正让开发者省事的是多角色对话:API里可以给每个角色分别指定声音和风格,一次性把整段对白合成出来。
Simon Willison用GPT-6 Astra写了个自带API Key就能用的网页测试台,靠Gemini API开放的CORS策略直接在浏览器里调用。他把合成参数存进URL,方便把调试配置直接分享给别人。
如果你只是想做有声书或播客式对话,这套组合把门槛压得很低。但成本仍需自己算:他实测 1 分 18 秒音频用了约 20 秒、2.74 美分,且用的是较贵的Flash TTS而非Flash-Lite。克隆声音那条还附带权利声明要求,不是随便拿一段录音就能用。
Simon Willison发布了一个名为Gemini 3.8 TTS Playground的测试工具,用于试用Google的Gemini 3.8文本转语音API。该工具支持单声道旁白和多说话人对话,可预览生成的音频,并查看请求与响应细节。
Google同日发布了两款新的Gemini文本转语音模型:gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts。二者附带超过 2000 种声音的库,并支持用「仅 30 秒的、你本人或你拥有使用权利的声音样本」创建自定义声音。
Willison表示,这个自带API Key的游乐场界面由他用GPT-6 Astra「凭感觉编码」(vibe coded)而成,利用了底层Gemini API开放的CORS策略。
他称该API的一个显著特性是便于定义多个角色之间的完整对话,每个角色可使用不同声音和声音风格指令。他放出了一段两只鹈鹕争论是否要搬到Pacifica Pier的演示片段,脚本由Claude 4.5 Opus编写,并由其生成URL交给该工具渲染。
据他描述,使用Gemini 3.8 Flash TTS(而非更便宜的Flash-Lite)生成 1 分 18 秒音频耗时约 20 秒,成本为 2.74 美分。
游乐场支持将合成设置保存为可加入书签的URL,便于分享;语音合成由使用者自己的Gemini API Key驱动。