产品The Decoder AI·原文 2026年9月11日

OpenAI将GPT-Live-1开放为API,支持全双工语音

该语音模型可同时听与说,在OpenAI基准测试中全双工交互得分 80.1%,前代为 45.4%;定价每分钟 0.05 美元。

AI解读:OpenAI把已在ChatGPT里跑着的语音模型GPT-Live-1开放给开发者调用,核心卖点是“全双工”——它能一边听一边说,而不是等你讲完再开口。

有真实使用场景的反馈:Yelp用它接电话预订,其CTO称呼叫处理有改善。这说明它先解决的是电话客服这类需要来回对话的任务。

OpenAI自己的基准显示,全双工交互得分从 45.4% 提到 80.1%,轮次延迟从 1.4 秒降到 0.8 秒,工具调用准确率从 60% 升到 87%。这些数字来自OpenAI,不是第三方验证。

价格每分钟 0.05 美元,规模化部署成本不低。模型可以搭配不同后端模型,按任务权衡推理深度、速度和成本;具体限制和完整细节要看API文档。

OpenAI将GPT-Live-1作为API提供给开发者。据The Decoder AI报道,该语音模型可以同时听和说,即所谓“全双工”(full-duplex),并且已经在ChatGPT内部运行。

开发者可搭配不同后端模型,定价每分钟 0.05 美元

开发者可以将GPT-Live-1与不同的后端模型配合使用,根据具体任务匹配推理深度、速度和成本。报道称,其价格为每分钟 0.05 美元,并不便宜。

GPT-Live-1附带十二种新语音,覆盖不同口音、方言和语言,并开箱提供ASR转录和响应文本。完整细节将在API文档中公布。

OpenAI基准测试:全双工交互 80.1%,轮次延迟降至 0.8 秒

在OpenAI的基准测试中,GPT-Live-1明显领先于前代模型。全双工交互测试中得分为 80.1%,而GPT-Realtime-2.1为 45.4%。

轮次切换延迟从 1.4 秒降至 0.8 秒。工具调用准确率从 60% 跃升至 87%。在一项银行语音支持基准测试中,GPT-Live-1通过率为 32%,前代模型为 12.4%。

Yelp用于电话预订,CTO称呼叫处理有改善

Yelp正在将该模型用于电话预订。据Yelp首席技术官Alex Levy称,呼叫处理有所改善。

信息来源

The Decoder AI原始来源