Google Gemini 4 Argon 缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先
Google 发布 Gemini 4 Argon,在关键基准上追平或部分超越 OpenAI 与 Anthropic 的前沿模型,支持最高一百万输出 token,并以每百万输入 2 美元、输出 10 美元的尝鲜价分阶段开放。
原贴
查看原文原文
中文翻译
Google 发布了 Gemini 4 Argon,这是其最新旗舰模型,缩小了与 OpenAI 和 Anthropic 前沿模型的差距,并在一些关键基准测试中击败了它们。
一项新功能:Argon 支持最多一百万个输出 token,使其能在单次运行中完成复杂推理而不超时。
Google 正分阶段推出 Argon,起步尝鲜价为每百万输入 token 2 美元、每百万输出 token 10 美元,之后常规价格将升至 4 美元和 20 美元。缓存输入享有 95% 折扣。
Argon 是 Google 在 Gemini 3.1 Pro 之后、七个多月以来的首个前沿模型。它让这家广告巨头重回三大 AI 实验室之列,不过 Anthropic 可能仍保持领先。
在经历了一段艰难而漫长、已经宣布的 Gemini 3.5 前沿模型被完全跳过的开发期后,Google 重新回到了竞赛中。Argon 最初将提供给一批“可信网络防御者”,作为 Fairwind 计划的一部分。他们和 Google 的内部团队将获得不带网络防护栏的模型。
Google 用这一类 AI 能力所需的“分阶段方式”来解释逐步推出。该公司还参与了美国政府的自愿计划,该计划让政府机构在新模型公开发布前就能使用它们。
来自早期测试者的反馈将进入模型的安全机制。只有在此之后,Google 才计划向开发者、企业和消费者开放 Argon,首先面向付费 API 客户和 Google AI Ultra 订阅者。公司没有给出日期,只说“尽快”。
定价已经确定,至少作为尝鲜价:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存输入 token 便宜 95%,约合每百万 10 美分。Gemini 3.8 Flash 的缓存折扣为 90%。
Google 还将输出上限从 64,000 提高到 100 万 token,称这是行业首创。其思路是,如果模型能在单条轨迹中生成数十万个 token,它就能更彻底地思考难题并一次解决。
为支持这一点,Google 在 Gemini API 中新增了“Long Decode Continuation”功能。它会暂停长回复,并通过后续请求恢复,使推理不会超时。输入上下文窗口保持 100 万 token。Argon 接受文本、图像、视频和音频输入,但只输出文本。
Artificial Analysis 提供了早期的独立评估。在其可用的最高推理等级“High”下,Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上得分 53 分。这与 OpenAI 的 GPT-6 Astra(max)和 Claude Fable 5.1 持平,并比 GPT-6.1 Sol(max)高出一分。
核心信息
Google 发布 Gemini 4 Argon,在关键基准上追平或部分超越 OpenAI 与 Anthropic 的前沿模型,支持最高一百万输出 token,并以每百万输入 2 美元、输出 10 美元的尝鲜价分阶段开放。
- Google 发布 Gemini 4 Argon,在关键基准上追平或部分超越 OpenAI 与 Anthropic 的前沿模型,支持最高一百万输出 token,并以每百万输入 2 美元、输出 10 美元的尝鲜价分阶段开放。
- 原贴提到:Google has unveiled Gemini 4 Argon, its latest flagship model that close
- 来源:the-decoder.com
详细解读
这是什么信号
Google 在 Gemini 3.1 Pro 之后隔了七个多月才拿出 Gemini 4 Argon,而且跳过了原本已宣布的 Gemini 3.5 前沿模型。这释放的信号不是“Google 领先了”,而是“Google 重新回到了牌桌上”:在关键基准上它追平甚至部分超过 OpenAI 与 Anthropic,但按原文说法并未取得明显领先。第三方 Artificial Analysis 给出的 53 分与 GPT-6 Astra(max)、Claude Fable 5.1 持平,只比 GPT-6.1 Sol(max)高 1 分。前沿模型的分数差已经进入个位数甚至 1 分的区间,继续把“谁更强”当作唯一采购依据,边际收益在快速下降。
为什么重要
两个变化值得注意。一是工程侧:Argon 把输出上限从 64,000 提升到 100 万 token,并在 Gemini API 中新增 Long Decode Continuation,让长回复可以暂停后用后续请求续写,避免超时。这意味着“一次推理跑完几十万 token”从不可行变成可排期,长代码生成、长文档产出、agent 多步轨迹这类任务的架构假设会随之改变。二是价格侧:每百万输入 2 美元、输出 10 美元的尝鲜价,叠加缓存输入 95% 折扣(约每百万 10 美分),把前沿模型的单价压到显著低于同行的水平。但原文提示这不代表 token 消耗更低——单价便宜不等于总成本便宜。
对谁有价值
对做 agent、长上下文检索和批量内容生成的团队,价值最直接:缓存折价 95% 对“同一份长上下文被反复调用”的负载是结构性降本。对技术选型负责人,Argon 提供了一个可平替的第三选项,多模型路由与议价筹码增加。对关注 AI 治理与合规的企业,Google 的分阶段路径值得研究——先给 Fairwind 计划下的“可信网络防御者”和内部团队不带网络防护栏的版本,再进入美国政府的新模型预发布自愿计划,最后才开放给 API 付费客户和 Google AI Ultra 订阅者,这说明前沿能力的可用性正被安全流程而非纯技术进度决定。
可以怎么行动
第一,不要因为“持平”就立刻迁移,也不要因为“没有明显领先”就忽视它;把 Argon 放进现有的多模型评测集,重点验证长输出与长推理任务在真实工作流中的稳定性。第二,如果你的负载缓存命中率高,按 95% 折扣重估成本曲线,并做一次 token 消耗量实测,而不是只看单价。第三,把“API 开放时间未定”当作架构约束:原文只给了“尽快”,不要把上线排期押在一个没有日期的依赖上。第四,需要无防护栏版本或预发布通道的团队,应先评估自身是否符合相应计划的准入条件。
风险与限制
定价是尝鲜价,之后将升至每百万输入 4 美元、输出 20 美元,成本模型需要按两档价格做敏感性测试。评测结论目前主要来自 Artificial Analysis 一个第三方来源,与竞品 1 分的差距在噪声范围内,不足以支撑“领先”叙事。输出上限提升,但输入上下文窗口仍为 100 万 token,且模型只输出文本,多模态输入的优势不等于多模态输出能力。此外,分阶段发布意味着公开可用的时间、区域和配额都存在不确定性,无防护栏版本仅限特定对象,企业合规团队需要提前确认使用边界。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《Google Gemini 4 Argon 缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
Google Gemini 4 Argon 缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先主要讲什么?
Google 发布 Gemini 4 Argon,在关键基准上追平或部分超越 OpenAI 与 Anthropic 的前沿模型,支持最高一百万输出 token,并以每百万输入 2 美元、输出 10 美元的尝鲜价分阶段开放。
这篇文章最值得关注的要点是什么?
Google 发布 Gemini 4 Argon,在关键基准上追平或部分超越 OpenAI 与 Anthropic 的前沿模型,支持最高一百万输出 token,并以每百万输入 2 美元、输出 10 美元的尝鲜价分阶段开放。;原贴提到:Google has unveiled Gemini 4 Argon, its latest flagship model that close;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。