阿里Qwen发布Qwen-Audio-3.1五款模型,音频AI价格最高下调95%
Qwen推出覆盖语音识别、语音合成和实时交互的五款模型,ASR降价最高约95%,TTS约70%,实时模型约85%。
AI解读:阿里Qwen团队发布Qwen-Audio-3.1,一次推出五款覆盖语音识别、语音合成和实时交互的模型。对做语音转写、多语言配音或实时语音助手的团队来说,这意味着可选方案变多,调用成本也明显下降。
主打能力各有侧重:ASR改善多语言和方言识别,还会自动清理口头禅与重复;ASR-Next额外支持带时间戳的多说话人识别,以及情绪、环境声和机器噪声检测。TTS支持多语言合成和跨语言音色迁移,用户用一句文本提示就能控制情绪、语速和风格。
价格调整是这次最直接的变化:TTS降价约70%,实时模型约85%,ASR最高约95%。降价幅度最大的是ASR,对大批量转写场景影响最明显。
仍待确认的是各模型的具体定价、可用区域和效果数据,来源仅提供摘要级信息,没有给出评测基准或与竞品的对比细节。
阿里Qwen团队发布Qwen-Audio-3.1,包含五款用于语音识别(ASR)、语音合成(TTS)和实时交互的模型。Qwen同时下调音频AI价格:TTS约降70%,实时模型约降85%,ASR最高降约95%。
据Qwen介绍,ASR模型改善了多语言和方言识别,并自动清理口头禅和重复内容。ASR-Next在此基础上增加带时间戳的多说话人识别,还能检测情绪、环境声和机器噪声。
TTS与实时模型能力
TTS模型处理多语言合成,支持自然的跨语言音色迁移。用户通过简单文本提示控制情绪、语速和风格,例如“用尖锐、命令式的语气朗读,要求被尊重”。
TTS-Next将语言模型与扩散方法结合,单次生成即可产出语音、音效和背景音频。实时模型支持边说边听,并能即时打断;Qwen表示,当它检测到用户情绪低落时,回应会更慢、更有同理心。
- ASR:改善多语言与方言识别,自动清理口头禅和重复
- ASR-Next:带时间戳的多说话人识别,检测情绪、环境声和机器噪声
- TTS:多语言合成,跨语言音色迁移,文本提示控制情绪、语速、风格
- TTS-Next:语言模型加扩散方法,单次生成语音、音效和背景音频
- 实时模型:边说边听,支持即时打断,检测低落后回应更慢更有同理心
降价幅度
Qwen给出的价格调整幅度为:TTS约降低70%,实时模型约降低85%,ASR最高降低95%。降价幅度最大的是ASR,对应的是大批量语音转写场景。
更多细节发布在Qwen博客和Qwen Cloud上。来源为The Decoder的报道,内容基于摘要级信息,未提供各模型的具体定价数字、开放区域或评测基准数据。