谷歌发布 Gemini 3.8 Live,以极低成本对标 OpenAI GPT-Live-1
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thinking 在 Artificial Analysis 语音到语音排行榜以 82.6% 排名第一,领先 OpenAI 最新的 GPT-Live-1。价格上,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,远低于 OpenAI 的 0.05 美元;一小时语音对话约 1.38 美元,OpenAI 至少 3 美元。但 OpenAI 全双工更自然,演示音质也更好。
原贴
查看原文原文
中文翻译
Google Deepmind 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking,这是两款面向开发者的新音频模型,可通过 Gemini API 和 Google AI Studio 使用。
Gemini 3.8 Live 为语音代理提供支持,这些代理可以在后台进行 API 调用、处理视觉输入并同时保持对话。它支持超过 97 种语言。
Extended Thinking 变体在 Artificial Analysis Speech-to-Speech Leaderboard 上以 82.6% 排名第一,领先于 OpenAI 最新的 GPT-Live-1 模型。示例应用在 GitHub 上。
Google 对音频输入收费为每分钟 0.005 美元,输出为 0.018 美元,远低于 OpenAI 的 GPT-Live-1 每分钟 0.05 美元。使用 Google 进行一小时的语音对话成本约为 1.38 美元,而 OpenAI 至少为 3.00 美元。
得益于全双工,OpenAI 的模型应该仍能提供更自然的对话,使其可以同时听和说。从演示来看,它听起来也更好,这表明 Google 再次以价格而非质量作为优化目标。
订阅 THE DECODER 可享受无广告阅读、每周 AI 新闻简报、每年六次的独家“AI Radar”前沿报告、完整档案访问以及评论区访问权限。
核心信息
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thinking 在 Artificial Analysis 语音到语音排行榜以 82.6% 排名第一,领先 OpenAI 最新的 GPT-Live-1。价格上,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,远低于 OpenAI 的 0.05 美元;一小时语音对话约 1.38 美元,OpenAI 至少 3 美元。但 OpenAI 全双工更自然,演示音质也更好。
- Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thinking 在 Artificial Analysis 语音到语音排行榜以 82.6% 排名第一,领先 OpenAI 最新的 GPT-Live-1。价格上,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,远低于 OpenAI 的 0.05 美元;一小时语音对话约 1.38 美元,OpenAI 至少 3 美元。但 OpenAI 全双工更自然,演示音质也更好。
- 原贴提到:Google Deepmind released Gemini 3.8 Live and 3.8 Live Extended Thinking,
- 来源:the-decoder.com
详细解读
这是什么信号
Google DeepMind 一次性发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,并且 Extended Thinking 在第三方语音到语音榜单上以 82.6% 排第一,超过 OpenAI 最新的 GPT-Live-1。这是 Google 在实时语音代理赛道上的正面进攻,而且选择用价格战切入。支持 97 种以上语言、后台 API 调用和视觉输入,说明它瞄准的不是简单语音问答,而是能边看、边做、边聊的代理型交互。
为什么重要
音频输入每分钟 0.005 美元、输出 0.018 美元,一小时语音对话约 1.38 美元,而 OpenAI GPT-Live-1 按每分钟 0.05 美元计算至少 3 美元。对于需要长时间在线的语音代理,成本直接决定能否规模化部署。Google 把价格压到对手的几分之一,同时用榜单成绩证明质量并不弱,这会迫使整个实时语音 API 市场重新定价。
对谁有价值
开发者、语音代理初创公司、客服与外呼团队、教育陪练、陪伴类产品以及需要多语言语音交互的企业,都能从更低的分钟成本中受益。正在使用 OpenAI 实时语音 API 的团队,也获得了一个可对比、可替代的选项。对关注 AI 商业竞争的人来说,这是观察语音交互落地拐点的关键信号。
可以怎么行动
可以先去 Google AI Studio 和 Gemini API 试用,用 GitHub 示例应用跑通语音代理流程;对现有语音链路做成本与延迟 A/B 测试,重点验证后台 API 调用和视觉输入是否满足业务;如果对自然度要求极高,可以保留 OpenAI 作为高端选项,按场景分层使用。建议把新模型纳入选型对比表,而不是立即全量迁移。
风险或限制
原文指出 OpenAI 的全双工让听和说同时进行,对话更自然,演示音质也更好。Google 可能再次以价格优先,牺牲了部分自然度。实际部署还需验证延迟、并发、合规和地区可用性等原文未披露的细节。价格优势能否抵消质量差距,取决于具体场景对自然度和响应速度的容忍度。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《谷歌发布 Gemini 3.8 Live,以极低成本对标 OpenAI GPT-Live-1》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
谷歌发布 Gemini 3.8 Live,以极低成本对标 OpenAI GPT-Live-1主要讲什么?
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理后台调用 API、处理视觉输入并持续对话,覆盖 97 种以上语言。Extended Thin…
这篇文章最值得关注的要点是什么?
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 和 Google AI Studio 使用。Gemini 3…;原贴提到:Google Deepmind released Gemini 3.8 Live and 3.8 Live Extended Thinking,;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「自动化、模型」等主题信号。;这篇内容命中「Agent、智能体」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。