觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-09-16 2 浏览 免费阅读

谷歌发布 Gemini 3.8 Live,以极低成本对标 OpenAI GPT-Live-1

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thinking 在 Artificial Analysis 语音到语音排行榜以 82.6% 排名第一,领先 OpenAI 最新的 GPT-Live-1。价格上,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,远低于 OpenAI 的 0.05 美元;一小时语音对话约 1.38 美元,OpenAI 至少 3 美元。但 OpenAI 全双工更自然,演示音质也更好。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-16 02:23:20

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Google Deepmind released Gemini 3.8 Live and 3.8 Live Extended Thinking, two new audio models for developers available through the Gemini API and Google AI Studio . Gemini 3.8 Live powers voice agents that can make API calls in the background, process visual input, and keep talking at the same time. It supports over 97 languages. The Extended Thinking variant ranks first on the Artificial Analysis Speech-to-Speech Leaderboard with 82.6 percent, ahead of OpenAI's latest GPT-Live-1 models . Sample apps are on GitHub . Google charges $0.005 per minute for audio input and $0.018 for output, far cheaper than OpenAI's GPT-Live-1 at $0.05 per minute. An hour of voice conversation costs about $1.38 with Google versus at least $3.00 with OpenAI. OpenAI's model should still deliver more natural conversations thanks to full duplex that lets it listen and speak at the same time. Judging from the demos, it also sounds better, suggesting Google once again optimized for price over quality. Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

Google Deepmind 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking,这是两款面向开发者的新音频模型,可通过 Gemini API 和 Google AI Studio 使用。

Gemini 3.8 Live 为语音代理提供支持,这些代理可以在后台进行 API 调用、处理视觉输入并同时保持对话。它支持超过 97 种语言。

Extended Thinking 变体在 Artificial Analysis Speech-to-Speech Leaderboard 上以 82.6% 排名第一,领先于 OpenAI 最新的 GPT-Live-1 模型。示例应用在 GitHub 上。

Google 对音频输入收费为每分钟 0.005 美元,输出为 0.018 美元,远低于 OpenAI 的 GPT-Live-1 每分钟 0.05 美元。使用 Google 进行一小时的语音对话成本约为 1.38 美元,而 OpenAI 至少为 3.00 美元。

得益于全双工,OpenAI 的模型应该仍能提供更自然的对话,使其可以同时听和说。从演示来看,它听起来也更好,这表明 Google 再次以价格而非质量作为优化目标。

订阅 THE DECODER 可享受无广告阅读、每周 AI 新闻简报、每年六次的独家“AI Radar”前沿报告、完整档案访问以及评论区访问权限。

核心信息

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thinking 在 Artificial Analysis 语音到语音排行榜以 82.6% 排名第一,领先 OpenAI 最新的 GPT-Live-1。价格上,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,远低于 OpenAI 的 0.05 美元;一小时语音对话约 1.38 美元,OpenAI 至少 3 美元。但 OpenAI 全双工更自然,演示音质也更好。

  • Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thinking 在 Artificial Analysis 语音到语音排行榜以 82.6% 排名第一,领先 OpenAI 最新的 GPT-Live-1。价格上,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,远低于 OpenAI 的 0.05 美元;一小时语音对话约 1.38 美元,OpenAI 至少 3 美元。但 OpenAI 全双工更自然,演示音质也更好。
  • 原贴提到:Google Deepmind released Gemini 3.8 Live and 3.8 Live Extended Thinking,
  • 来源:the-decoder.com

详细解读

这是什么信号

Google DeepMind 一次性发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,并且 Extended Thinking 在第三方语音到语音榜单上以 82.6% 排第一,超过 OpenAI 最新的 GPT-Live-1。这是 Google 在实时语音代理赛道上的正面进攻,而且选择用价格战切入。支持 97 种以上语言、后台 API 调用和视觉输入,说明它瞄准的不是简单语音问答,而是能边看、边做、边聊的代理型交互。

为什么重要

音频输入每分钟 0.005 美元、输出 0.018 美元,一小时语音对话约 1.38 美元,而 OpenAI GPT-Live-1 按每分钟 0.05 美元计算至少 3 美元。对于需要长时间在线的语音代理,成本直接决定能否规模化部署。Google 把价格压到对手的几分之一,同时用榜单成绩证明质量并不弱,这会迫使整个实时语音 API 市场重新定价。

对谁有价值

开发者、语音代理初创公司、客服与外呼团队、教育陪练、陪伴类产品以及需要多语言语音交互的企业,都能从更低的分钟成本中受益。正在使用 OpenAI 实时语音 API 的团队,也获得了一个可对比、可替代的选项。对关注 AI 商业竞争的人来说,这是观察语音交互落地拐点的关键信号。

可以怎么行动

可以先去 Google AI Studio 和 Gemini API 试用,用 GitHub 示例应用跑通语音代理流程;对现有语音链路做成本与延迟 A/B 测试,重点验证后台 API 调用和视觉输入是否满足业务;如果对自然度要求极高,可以保留 OpenAI 作为高端选项,按场景分层使用。建议把新模型纳入选型对比表,而不是立即全量迁移。

风险或限制

原文指出 OpenAI 的全双工让听和说同时进行,对话更自然,演示音质也更好。Google 可能再次以价格优先,牺牲了部分自然度。实际部署还需验证延迟、并发、合规和地区可用性等原文未披露的细节。价格优势能否抵消质量差距,取决于具体场景对自然度和响应速度的容忍度。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《谷歌发布 Gemini 3.8 Live,以极低成本对标 OpenAI GPT-Live-1》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

谷歌发布 Gemini 3.8 Live,以极低成本对标 OpenAI GPT-Live-1主要讲什么?

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thin…

这篇文章最值得关注的要点是什么?

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3…;原贴提到:Google Deepmind released Gemini 3.8 Live and 3.8 Live Extended Thinking,;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「自动化、模型」等主题信号。;这篇内容命中「Agent、智能体」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 GitHub Copilot 可建议自定义属性定义 下一篇 AI 实验室面临数据信任问题,其政策尚未解决