Grok 4.5 相比 Fable 5 和 GPT 5.5 如此便宜,基准测试差距可能没那么重要
xAI 发布 Grok 4.5,性能接近顶尖模型但价格远低于竞品,采用低价策略抢占市场。
原贴
查看原文原文
中文翻译
xAI 发布了 Grok 4.5。该模型在数万个英伟达 GB300 GPU 上训练,针对编程、代理任务和知识工作。基准测试结果喜忧参半。在测试复杂命令行任务的 Terminal Bench 2.1 上,Grok 4.5 得分 83.3%,几乎与 GPT 5.5(83.4%)持平,仅落后 Anthropic 的 Fable 5(84.3%)一个百分点。但在其他方面差距更大。在衡量解决真实 GitHub 问题能力的 DeepSWE 1.1 上,Grok 4.5 达到 53%,远低于 OpenAI 的 GPT-5.5(67%)和 Fable 5(70%)。在 SWE Bench Pro(一套精选的更难软件工程问题)上,其得分为 64.7%,在某些配置下击败了 Opus 4.8(最大设置下为 69.2%),但不及 Fable 5 的 80.4%。xAI 表示,在训练过程中依赖大量数据过滤、去重和领域特定选择来保持数据质量。强化学习阶段涵盖了数十万个任务,大多来自软件工程,并采用自动评分。xAI 构建了异步学习的训练基础设施,因此代理运行可以持续数小时,同时训练并行进行。Grok 4.5 每百万输入令牌收费 2 美元,每百万输出令牌收费 6 美元。这已经远低于竞争对手。Opus 4.8 每百万令牌输入 5 美元、输出 25 美元。Fable 5 每百万令牌输入 10 美元、输出 50 美元。GPT-5.5 和 GPT-5.6 分别为输入 5 美元、输出 30 美元。xAI 还表示,Grok 4.5 在 SWE Bench Pro 任务上使用的令牌数比 Opus 4.8 少 4.2 倍,并以每秒 80 令牌的速度交付结果。更低的单位定价和更少的每任务令牌数使得 Grok 4.5 成为该性能层级中最便宜的选择——前提是性能和效率提升在实践中成立。这一定价策略呼应了中国厂商如智谱和 DeepSeek 的做法:性能足够接近,然后以价格取胜。Grok 4.5 现已通过 Grok Build、Cursor 和 xAI 控制台提供。Word、PowerPoint 和 Excel 的插件也已上线。该模型尚未在欧盟可用,xAI 计划 7 月中旬推出。xAI 与代码编辑器 Cursor(SpaceX 于 6 月中旬以 600 亿美元股票收购)一同训练了 Grok 4.5。订阅 THE DECODER 以获取无广告阅读、每周 AI 新闻简报、每年六次的独家“AI 雷达”前沿报告、完整存档访问以及评论区的访问权限。
核心信息
xAI 发布 Grok 4.5,性能接近顶尖模型但价格远低于竞品,采用低价策略抢占市场。
- xAI 发布 Grok 4.5,性能接近顶尖模型但价格远低于竞品,采用低价策略抢占市场。
- 原贴提到:xAI has released Grok 4.5. The model was trained on tens of thousands of
- 来源:the-decoder.com
详细解读
这是什么信号:Grok 4.5 的发布表明 xAI 正采取明确的低价渗透策略,在性能接近顶级模型(如 Fable 5、GPT 5.5)的情况下,通过大幅降价抢占市场份额。这标志着 AI 模型竞争从单纯性能比拼转向性价比和成本效率的全面竞争。
为什么重要:对于企业和开发者而言,模型选择的决策因子正在改变。过去性能优先,现在成本成为关键变量。Grok 4.5 的低价(仅为 Fable 5 的 1/5)可能加速 AI 应用的规模化部署,尤其是对成本敏感的创业公司和中小型企业。同时,xAI 强调的训练数据质量和异步学习基础设施,展示了通过工程优化降低成本的可行性。
对谁有价值:软件工程团队和 AI 应用开发者是直接受益者,他们可以以更低成本获取接近顶级的编程和代理任务能力。AI 模型采购决策者需要重新评估预算和供应商选择。中国 AI 厂商的定价策略被验证有效,可能吸引更多跟随者。
可以怎么行动:开发者应立即通过 Grok Build 或 Cursor 测试 Grok 4.5 在自身工作流中的实际表现,对比性能和成本。企业可将 Grok 4.5 作为高性价比备选模型纳入采购清单,用于非关键任务或高吞吐场景。同时关注其欧盟发布时间(7 月中旬),提前规划合规部署。
风险或限制:基准测试的差距在复杂软件工程任务中仍存在(如 SWE Bench Pro 落后 Fable 5 约 16 个百分点),可能不适合对精度要求极高的场景。低价策略的可持续性存疑,xAI 可能在未来提价或调整服务条款。另外,模型尚未在欧盟可用,且训练数据的透明度有限,可能引发监管或信任风险。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《Grok 4.5 相比 Fable 5 和 GPT 5.5 如此便宜,基准测试差距可能没那么重要》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
Grok 4.5 相比 Fable 5 和 GPT 5.5 如此便宜,基准测试差距可能没那么重要主要讲什么?
xAI 发布 Grok 4.5,性能接近顶尖模型但价格远低于竞品,采用低价策略抢占市场。
这篇文章最值得关注的要点是什么?
xAI 发布 Grok 4.5,性能接近顶尖模型但价格远低于竞品,采用低价策略抢占市场。;原贴提到:xAI has released Grok 4.5. The model was trained on tens of thousands of;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「自动化、模型」等主题信号。;这篇内容命中「智能体」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。