OpenAI 的 GPT-Live-1 API 让开发者构建能同时说和听的应用
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具调用准确率从 60% 升至 87%,银行语音支持通过率从 12.4% 提升到 32%。Yelp 已将其用于电话预订。
原贴
查看原文原文
中文翻译
OpenAI 正在把 GPT-Live-1 作为 API 提供给开发者。这个语音模型可以同时听和说,这一特性被称为“全双工”,并且已经在 ChatGPT 内部运行。开发者可以根据任务把它与不同的后端模型搭配,为每个使用场景匹配推理深度、速度和成本。每分钟 0.05 美元,这并不便宜。据 CTO Alex Levy 称,Yelp 正在把该模型用于电话预订,并报告电话处理效果更好。在 OpenAI 的基准测试中,GPT-Live-1 大幅领先于其前代模型。在全双工交互测试中,它得分 80.1%,而 GPT-Realtime-2.1 为 45.4%。轮次转换延迟从 1.4 秒降至 0.8 秒。工具调用准确率从 60% 跃升至 87%。在一项银行语音支持基准测试中,GPT-Live-1 达到 32% 的通过率,高于前代模型的 12.4%。GPT-Live-1 还附带十二种新声音,覆盖不同口音、方言和语言。它开箱即提供 ASR 转录和响应文本。完整细节将在 API 文档中提供。
核心信息
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具调用准确率从 60% 升至 87%,银行语音支持通过率从 12.4% 提升到 32%。Yelp 已将其用于电话预订。
- OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具调用准确率从 60% 升至 87%,银行语音支持通过率从 12.4% 提升到 32%。Yelp 已将其用于电话预订。
- 原贴提到:OpenAI is making GPT-Live-1 available to developers as an API. The speec
- 来源:the-decoder.com
详细解读
这是什么信号
OpenAI 把 GPT-Live-1 从 ChatGPT 内部能力变成公开 API。关键不在于“又一个语音模型”,而在于全双工:模型可以一边听一边说,而不是传统语音助手那种“你说完—它再说”的轮流制。这说明实时语音交互正在从产品功能,下沉为开发者可直接调用的基础设施。
第二条信号是架构上的解耦。开发者可以把 GPT-Live-1 当作语音前端,再按任务接不同后端模型,去匹配推理深度、速度和成本。这实际上把“听觉/表达层”和“思考层”拆开计价,让语音 Agent 的成本结构变得可调。
为什么重要
原文给出的三组数字,指向同一件事:对话体验的瓶颈正在从“理解得准不准”转向“接得上不上”。全双工交互测试从 45.4% 提升到 80.1%,轮次转换延迟从 1.4 秒砍到 0.8 秒,工具调用准确率从 60% 升到 87%。延迟减半加上打断、插话、抢话的处理能力,才是电话场景真正可用的前提——人类的对话本来就是重叠的。
但也要看到天花板:银行语音支持基准的通过率只有 32%,虽然比前代的 12.4% 翻了不止一倍,仍意味着将近七成的复杂任务没有通过。它是一次代际跳升,不是“语音客服可以全自动裁人”的拐点。
对谁有价值
最直接的是做电话与实时语音场景的团队:订位、预约、外呼、客服初筛、语音助手、陪伴类产品。Yelp 已经把模型用于电话预订并报告电话处理更好,说明这类场景的收益是可被业务方感知的,而不只是跑分。
其次是把语音当入口、后端模型当大脑的 Agent 开发者。过去语音链路的工程复杂度常常吃掉大部分迭代预算,托管式全双工 API 把这个门槛降下来了。再次是评估“语音 Agent 是否值得上”的产品与运营负责人——现在可以用每分钟 0.05 美元的明确单价做单次通话的成本测算,而不是靠猜。
可以怎么行动
第一,先用自家真实通话录音建一个小评测集,重点不是准确率,而是打断响应、延迟和工具调用成功率,这三项决定用户是否会挂断。第二,把“语音层”和“推理层”分开设计:高频、低复杂度的环节用便宜快速的后端模型,只有需要深度判断的节点才升级模型,把每分钟 0.05 美元之上的推理成本控制住。第三,先挑一个高价值、容错度高的场景跑通,比如预订、查单、满意度回访,而不是一上来就碰银行级合规任务。第四,等 API 文档公开后再确认限流、语言覆盖与数据留存条款,再决定是否进入生产架构。
风险与限制
成本是第一道限制:每分钟 0.05 美元,一通十分钟的电话就是 0.5 美元的模型侧成本,再叠加后端模型调用,规模化外呼场景的经济模型需要重新算。
能力是第二道限制:银行语音支持 32% 的通过率说明复杂、多轮、带合规约束的任务仍不可靠,工具调用 87% 也意味着仍有约八分之一的调用出错,必须配兜底与人工接管。
第三是信息不完整:原文明确表示完整细节将在 API 文档中提供,当前能确认的只有价格、基准与声音数量,关于并发、区域可用性、数据使用与合规认证尚无公开依据,任何据此做出的架构承诺都应保留调整空间。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《OpenAI 的 GPT-Live-1 API 让开发者构建能同时说和听的应用》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
OpenAI 的 GPT-Live-1 API 让开发者构建能同时说和听的应用主要讲什么?
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具…
这篇文章最值得关注的要点是什么?
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.0…;原贴提到:OpenAI is making GPT-Live-1 available to developers as an API. The speec;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「工具、自动化、模型」等主题信号。;这篇内容命中「Agent、智能体」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。