模型The Decoder AI·原文 2026年9月29日

ElevenLabs发布v4语音模型:Turbo版 150 毫秒出声,支持 90 多种语言

v4主打长音频中的音色一致性与更准的语音标签控制,支持 90 多种语言;Turbo变体面向实时语音代理,ElevenLabs内部测试中 150 毫秒开始出声。标准API价 80 美元/百万字符,10 月 12 日前降至 22 美元。

AI解读:ElevenLabs发布Eleven v4语音模型,重点解决两个老问题:长内容里音色会飘,以及脚本里写的“笑”“耳语”“关门声”不一定照做。官方说法是v4能分析脚本的语气、节奏和上下文,标签跟得更准,重新生成某一句后整体声音也更一致。

对做有声书、配音的人来说,单次最多 1 万字符(约 10 分钟),更长的作品要分段,但官方称跨段落的节奏和表达能保持稳定。克隆音色说外语时也不会再漂回原来的口音,这在多语言配音里是直接省事的地方。

实时场景有单独的Turbo:官方测试中 150 毫秒开始出声,对比Cartesia Sonic 3.6的 262 毫秒和OpenAI GPT-4o mini TTS的 814 毫秒。这些数字来自ElevenLabs自己的对比,不是第三方复测。

价格方面,v4标准API为每百万字符 80 美元,Turbo为 40 美元,10 月 12 日前分别降到 22 美元和 11 美元;Creator套餐(22 美元/月)及以上可在ElevenCreative免费使用v4两周,用量上限为当月额度的两倍。

v4在Artificial Analysis的Voice Arena排行榜上排在Cartesia Sonic 3.6和Google Gemini 3.8 Flash TTS之前,发音基准得分 91.7%,v3为 85.6%;盲测中约四分之三的听众更偏好v4。这些评测结果由ElevenLabs或第三方平台给出,实际体验仍取决于具体语言和文本。

ElevenLabs发布新一代语音模型Eleven v4,官方称其在长音频制作中保持音色一致,并更准确地执行脚本里的情绪、停顿和音效标签。同时推出面向实时语音代理的Turbo变体,官方测试中约 150 毫秒开始出声。

v4支持 90 多种语言,v3约为 70 种。单次请求最多处理 1 万字符,约 10 分钟音频;更长的有声书等内容需要分段生成,ElevenLabs称跨段落的节奏和表达预期保持一致。

v4能生成笑声、耳语、关门声等声音,v3发布于一年多前,已支持这些音频标签,但执行准确度较低。用户可以用标签或普通句子给出指令,并可用音标拼写指定人名和技术术语的发音,公司称发音控制现在更可靠。

官方称v4采用新架构分析脚本的语气、节奏和上下文;旁白和角色在整个制作中应保持一致,即使用户多次重新生成单行。对话场景中,AI说话人会根据整个场景的上下文回应,而不是孤立地逐行输出。

克隆音色在说其他语言时应带母语口音,且不会随时间漂回原口音。Professional Voice Clones在v3中不受支持,现在恢复可用;“Instant Voice Clone”只需 10 秒音频。

Turbo面向客服电话、游戏角色等实时场景。ElevenLabs称语音代理开发者此前需要在速度和表现力之间取舍,v4 Turbo意在两者兼顾。在该公司测试中,Turbo开始发出可听语音耗时 150 毫秒,Cartesia Sonic 3.6为 262 毫秒,OpenAI的GPT-4o mini TTS为 814 毫秒。Turbo与ElevenAgents平台一同优化。

排行榜与盲测:v4排在前列,但数据来自厂商或指定平台

在Artificial Analysis的Provider Voice Arena排行榜上,Eleven v4排在Cartesia Sonic 3.6和Google Gemini 3.8 Flash TTS之前。v4在发音基准上得分 91.7%,v3为 85.6%。

ElevenLabs的盲测中,约四分之三的听众在对比Cartesia、Inworld和Google的模型时更偏好v4。该公司的另一组盲测中,听众在 65% 到 81% 的对比里认为v4表现力更强,具体比例取决于对手模型。

定价与可用性:标准价 80 美元/百万字符,10 月 12 日前有临时折扣

ElevenLabs标准API定价为v4每百万字符 80 美元,Turbo为 40 美元。到 10 月 12 日为止,价格分别降至 22 美元和 11 美元。

ElevenLabs称,22 美元/月的Creator套餐及以上用户可在ElevenCreative中免费使用v4两周,用量上限为其月度额度的两倍。作为对比,Artificial Analysis列出Cartesia Sonic 3.6为每百万字符 49 美元,Gemini 3.8 Flash TTS为 16.49 美元。

两款模型现已在ElevenAgents、ElevenCreative和API中可用。ElevenLabs文档称客户数据默认存储在美国;企业客户可将数据存储在欧盟、印度或新加坡的隔离环境中,但部分处理可能在所选区域之外进行。在欧盟,客户可使用不保留数据的模式将API处理保持在本地区内。

配音用途与声音授权

更高品质的声音克隆让v4可用于配音,ElevenLabs宣传的能力是让演员的声音覆盖所有支持的语言。公司从声音本人处获得授权。

配音演员可以在ElevenLabs的声音库中提供经过大量训练的克隆声音,当付费用户使用时获得收入。ElevenLabs已通过专门的市场提供迈克尔·凯恩等名人声音。

同期动态:Music 2.5模型

ElevenLabs还在 9 月中旬发布了Music 2.5模型,旨在生成更密集、更自然的歌曲。

信息来源

The Decoder AI原始来源