模型ElevenLabs Blog·原文 2026年9月28日

ElevenLabs发布Eleven v4语音模型:情感表达升级,Turbo版首包延迟约150毫秒

ElevenLabs推出新一代文本转语音模型Eleven v4及低延迟版本Eleven v4 Turbo,支持超过90种语言,官方称在盲测对比中被约75%的听众偏好,Artificial Analysis将其列为第一。

AI解读:ElevenLabs发布了Eleven v4和Eleven v4 Turbo两款文本转语音模型,前者主打情感表达,后者面向低延迟场景。官方称新模型基于全新架构,在Artificial Analysis的语音竞技场排行榜上排名第一,并在与Cartesia Sonic 3.6、Inworld TTS-2及谷歌Gemini TTS系列的盲测对比中,被约75%的听众偏好。

对做有声书、配音、游戏角色或客服Agent的人来说,最直接的变化是模型能按自然语言指令和行内标签控制语气、语速、情绪甚至音效,比如[laughs]、[said angrily in French accent],这比之前只能“读出来”要实用得多。多说话人对话也更有来有回,而不是把几条独立录音拼在一起。

Turbo版主攻速度与情感的取舍:官方给出的中位首包延迟约150毫秒,推理延迟约100毫秒。此前高质量的语音模型往往较慢,做语音Agent时经常只能在“快但单调”和“像人但慢”之间二选一,Eleven v4 Turbo试图同时保住两端。

声音克隆门槛进一步降低:即时克隆只需约10秒音频就能达到较高保真度,且新增Professional Voice Clones支持最高保真的克隆场景。跨语言方面,一段录音可以用超过90种语言输出,并采用母语者口音,官方称口音保持比之前明显更稳,不会生成到一半漂回原口音。

这些模型现已通过ElevenAgents、ElevenCreative和ElevenAPI开放。需要注意的是,排名和偏好数据来自ElevenLabs博客引用的Artificial Analysis 2026年9月榜单及自家盲测,尚未看到独立第三方的大规模可复现评测,实际表现仍需按具体场景验证。

ElevenLabs今日发布Eleven v4和Eleven v4 Turbo两款文本转语音模型。官方称Eleven v4是该公司“迄今最具情感表现力”的TTS模型,Eleven v4 Turbo则是面向低延迟场景的变体,两者均支持超过90种语言,现已通过ElevenAgents、ElevenCreative和ElevenAPI提供。

官方称Artificial Analysis排名第一,盲测偏好率约75%

ElevenLabs称,Eleven v4在Artificial Analysis的Provider Voice Arena Leaderboard(2026年9月)上排名第一。该结论来自ElevenLabs博客,并非独立验证。

在盲测对比中,听众对同一句话分别听取Eleven v4和一款竞品模型的输出,判断哪边更具表现力、哪边听起来更自然,平局计半分。ElevenLabs称约75%的听众偏好Eleven v4。对比对象包括Cartesia Sonic 3.6、Inworld TTS-2、Google Gemini 3.8 Flash-Lite TTS和Google Gemini 3.8 Flash TTS。

支持自然语言指令与行内标签,可指定情绪、口音和音效

Eleven v4允许用户用自然语言描述一句话该怎么念,也可以通过行内标签指定情绪和音效。ElevenLabs给出的示例包括[laughs]、[said angrily in French accent]、[light rain]和[phone buzzing]。官方称新模型比以前更准确地遵循这些音频标签和指导提示。

国际音标(IPA)音素支持也有显著改进,自定义发音更可靠。ElevenLabs开发者文档包含完整的标签语法及通过API使用这些标签的方法。

多说话人对话更像对话,请求拼接更可靠

Eleven v4在多位说话人之间的一致性上有改进。ElevenLabs称模型采用新的说话人身份捕捉方法,能保留每个声音的独特特征,并在Agent对话、有声书和广告中保持语音一致。

由于模型理解整个场景的上下文,生成的对话是说话人回应上一句话的结果,而不是把孤立的句子拼接起来。ElevenLabs还称,用于长内容生成的“请求拼接”(把多次生成串联起来)在Eleven v4中明显更可靠,这改善了ElevenLabs Studio和ElevenLabs Reader App的使用体验。

Turbo版首包延迟约150毫秒,与ElevenAgents一起优化

Eleven v4 Turbo的中位首次发声时间约为150毫秒,Eleven v4的推理延迟中位数约为100毫秒。ElevenLabs称后者快于两个人对话时平均停顿的时间。

ElevenLabs称,这些延迟数据于2026年9月用相同脚本和默认设置测得,对比对象包括Cartesia Sonic 3.6、xAI TTS、Google Gemini Flash-Lite TTS和OpenAI GPT-4o mini TTS;所有系统的网络延迟均已测量并扣除,Eleven v4 Turbo通过WebSocket流式传输测试。

Eleven v4 Turbo与ElevenLabs的对话式Agent平台ElevenAgents配套使用。ElevenLabs称,其他Agent构建者把不同供应商的模型和软件拼在一起,用户无法针对自己的用例改进模型输出;而ElevenLabs的研究和工程团队把Eleven v4 Turbo与ElevenAgents作为一套系统一起优化。

声音克隆:10秒音频即可即时克隆,新增PVC支持

Eleven v4和Eleven v4 Turbo的声音克隆在真实度、能力和一致性上都有提升,与原始源声音的说话人相似度显著变好。即时声音克隆(Instant Voice Clones)现在只需约10秒音频就能高保真地捕捉声音。

Eleven v4在多次生成、对话、旁白和重新生成的台词中能更可靠地保留说话人身份,因此长篇项目中的角色、旁白和克隆声音能在整个制作过程中保持一致。Eleven v4还新增对Professional Voice Clones(PVC)的支持,用于对保真度要求最高的克隆场景。

跨语言:90多种语言,采用母语者口音

Eleven v4和Eleven v4 Turbo支持超过90种语言。ElevenLabs称,模型不仅改进了发音,还更好地捕捉了不同语言中的节奏、情绪和表达方式。

官方称,一段用一种语言录制的声音现在可以用任何其他支持的语言流利说话,并采用母语者的口音,同时保留原始声音的身份。口音保持比之前明显更强,声音不会在生成过程中漂回源口音。对配音和本地化来说,这意味着品牌选定的声音——无论是合作的明星演员还是符合公司风格的音色——在Eleven v4支持的任何语言中都能有较好表现。

信息来源

ElevenLabs Blog原始来源