觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-09-11 2 浏览 免费阅读

OpenAI 的 GPT-Live-1 API 让开发者构建能同时说和听的应用

OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具调用准确率从 60% 升至 87%,银行语音支持通过率从 12.4% 提升到 32%。Yelp 已将其用于电话预订。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-11 01:47:35

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

OpenAI is making GPT-Live-1 available to developers as an API. The speech model can listen and talk at the same time, a feature known as "full-duplex," and is already running inside ChatGPT. Developers can pair it with different backend models depending on the task, matching reasoning depth, speed, and cost to each use case. At $0.05 per minute, it's not cheap. Yelp is using the model for phone-based reservations and reports better call handling, according to CTO Alex Levy . On OpenAI's benchmarks, GPT-Live-1 pulls well ahead of its predecessors. In full-duplex interactivity tests, it scores 80.1 percent compared to 45.4 percent for GPT-Realtime-2.1 . Turn-taking latency drops to 0.8 seconds from 1.4 seconds. Tool-calling accuracy jumps to 87 percent from 60 percent. In a banking voice support benchmark, GPT-Live-1 hits a 32 percent pass rate, up from 12.4 percent for the previous model. GPT-Live-1 also ships with twelve new voices spanning different accents, dialects, and languages. It provides ASR transcripts and response text out of the box. Full details will be available in the API documentation . Ad Ad Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

OpenAI 正在把 GPT-Live-1 作为 API 提供给开发者。这个语音模型可以同时听和说,这一特性被称为“全双工”,并且已经在 ChatGPT 内部运行。开发者可以根据任务把它与不同的后端模型搭配,为每个使用场景匹配推理深度、速度和成本。每分钟 0.05 美元,这并不便宜。据 CTO Alex Levy 称,Yelp 正在把该模型用于电话预订,并报告电话处理效果更好。在 OpenAI 的基准测试中,GPT-Live-1 大幅领先于其前代模型。在全双工交互测试中,它得分 80.1%,而 GPT-Realtime-2.1 为 45.4%。轮次转换延迟从 1.4 秒降至 0.8 秒。工具调用准确率从 60% 跃升至 87%。在一项银行语音支持基准测试中,GPT-Live-1 达到 32% 的通过率,高于前代模型的 12.4%。GPT-Live-1 还附带十二种新声音,覆盖不同口音、方言和语言。它开箱即提供 ASR 转录和响应文本。完整细节将在 API 文档中提供。

核心信息

OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具调用准确率从 60% 升至 87%,银行语音支持通过率从 12.4% 提升到 32%。Yelp 已将其用于电话预订。

  • OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具调用准确率从 60% 升至 87%,银行语音支持通过率从 12.4% 提升到 32%。Yelp 已将其用于电话预订。
  • 原贴提到:OpenAI is making GPT-Live-1 available to developers as an API. The speec
  • 来源:the-decoder.com

详细解读

这是什么信号

OpenAI 把 GPT-Live-1 从 ChatGPT 内部能力变成公开 API。关键不在于“又一个语音模型”,而在于全双工:模型可以一边听一边说,而不是传统语音助手那种“你说完—它再说”的轮流制。这说明实时语音交互正在从产品功能,下沉为开发者可直接调用的基础设施。

第二条信号是架构上的解耦。开发者可以把 GPT-Live-1 当作语音前端,再按任务接不同后端模型,去匹配推理深度、速度和成本。这实际上把“听觉/表达层”和“思考层”拆开计价,让语音 Agent 的成本结构变得可调。

为什么重要

原文给出的三组数字,指向同一件事:对话体验的瓶颈正在从“理解得准不准”转向“接得上不上”。全双工交互测试从 45.4% 提升到 80.1%,轮次转换延迟从 1.4 秒砍到 0.8 秒,工具调用准确率从 60% 升到 87%。延迟减半加上打断、插话、抢话的处理能力,才是电话场景真正可用的前提——人类的对话本来就是重叠的。

但也要看到天花板:银行语音支持基准的通过率只有 32%,虽然比前代的 12.4% 翻了不止一倍,仍意味着将近七成的复杂任务没有通过。它是一次代际跳升,不是“语音客服可以全自动裁人”的拐点。

对谁有价值

最直接的是做电话与实时语音场景的团队:订位、预约、外呼、客服初筛、语音助手、陪伴类产品。Yelp 已经把模型用于电话预订并报告电话处理更好,说明这类场景的收益是可被业务方感知的,而不只是跑分。

其次是把语音当入口、后端模型当大脑的 Agent 开发者。过去语音链路的工程复杂度常常吃掉大部分迭代预算,托管式全双工 API 把这个门槛降下来了。再次是评估“语音 Agent 是否值得上”的产品与运营负责人——现在可以用每分钟 0.05 美元的明确单价做单次通话的成本测算,而不是靠猜。

可以怎么行动

第一,先用自家真实通话录音建一个小评测集,重点不是准确率,而是打断响应、延迟和工具调用成功率,这三项决定用户是否会挂断。第二,把“语音层”和“推理层”分开设计:高频、低复杂度的环节用便宜快速的后端模型,只有需要深度判断的节点才升级模型,把每分钟 0.05 美元之上的推理成本控制住。第三,先挑一个高价值、容错度高的场景跑通,比如预订、查单、满意度回访,而不是一上来就碰银行级合规任务。第四,等 API 文档公开后再确认限流、语言覆盖与数据留存条款,再决定是否进入生产架构。

风险与限制

成本是第一道限制:每分钟 0.05 美元,一通十分钟的电话就是 0.5 美元的模型侧成本,再叠加后端模型调用,规模化外呼场景的经济模型需要重新算。

能力是第二道限制:银行语音支持 32% 的通过率说明复杂、多轮、带合规约束的任务仍不可靠,工具调用 87% 也意味着仍有约八分之一的调用出错,必须配兜底与人工接管。

第三是信息不完整:原文明确表示完整细节将在 API 文档中提供,当前能确认的只有价格、基准与声音数量,关于并发、区域可用性、数据使用与合规认证尚无公开依据,任何据此做出的架构承诺都应保留调整空间。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《OpenAI 的 GPT-Live-1 API 让开发者构建能同时说和听的应用》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

OpenAI 的 GPT-Live-1 API 让开发者构建能同时说和听的应用主要讲什么?

OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.05 美元。基准测试显示其全双工交互得分 80.1%(前代 45.4%)、轮次转换延迟从 1.4 秒降至 0.8 秒、工具…

这篇文章最值得关注的要点是什么?

OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,其核心能力是“全双工”——可同时听与说,并已在 ChatGPT 内部运行。开发者可按任务搭配不同后端模型,在推理深度、速度与成本之间做取舍,定价为每分钟 0.0…;原贴提到:OpenAI is making GPT-Live-1 available to developers as an API. The speec;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「工具、自动化、模型」等主题信号。;这篇内容命中「Agent、智能体」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 GitHub 代码扫描的 PR AI Scan 进入公开预览,可用 REST API 管理 下一篇 WorkBuddy 上线 DeepSeek V4.1-Flash,免费试用两周