觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-09-22 3 浏览 免费阅读

xAI 低价发布 Grok 4.7,但基准测试显示与 Claude 和 GPT-6 差距明显

xAI 发布 Grok 4.7,主打编程与知识工作,定价每百万输入 2 美元、输出 6 美元;但在 Artificial Analysis 指数和 Terminal-Bench 4.0 上明显落后于 Claude Fable 5.1 与 GPT-6。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-22 00:56:36

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Elon Musk's xAI has introduced Grok 4.7, its most capable model yet for coding and knowledge work. It's built on a larger base model, trained with longer reinforcement learning, and designed to better verify its own output, according to the company. Pricing sits at $2 per million input tokens and $6 per million output tokens. Those rates are closer to Chinese models than Western frontier models, probably for good reason. On the independent Artificial Analysis Intelligence Index (v4.3.2), which combines ten benchmarks, Grok 4.7 scores 46 and lands mid-pack. Claude Fable 5.1 and GPT-6 lead with 53 each. The gap grows wider in agentic coding. On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra and 55 percent for Claude Fable 5.1. Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent. The model is available through the Grok API , Cursor , and Grok Build . Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

Elon Musk 的 xAI 推出了 Grok 4.7,这是其迄今在编程和知识工作方面能力最强的模型。据该公司称,它构建在更大的基础模型之上,使用更长的强化学习训练,并旨在更好地验证自身输出。定价为每百万输入 token 2 美元、每百万输出 token 6 美元。这些价格更接近中国模型,而不是西方前沿模型,可能是有充分理由的。在独立的 Artificial Analysis Intelligence Index(v4.3.2)上,该指数综合了十项基准测试,Grok 4.7 得分为 46,处于中游。Claude Fable 5.1 和 GPT-6 以 53 分领先。在智能体编程方面,差距进一步扩大。在 Terminal-Bench 4.0 上,Grok 4.7 仅达到 26%,而 GPT-6 Astra 为 60%,Claude Fable 5.1 为 55%。甚至更便宜的 DeepSeek V4.1 Flash 也以 27% 略胜它。该模型可通过 Grok API、Cursor 和 Grok Build 使用。订阅 THE DECODER 可享受无广告阅读、每周 AI 通讯、我们每年六期的独家“AI Radar”前沿报告、完整档案访问以及访问我们的评论区。

核心信息

xAI 发布 Grok 4.7,主打编程与知识工作,定价每百万输入 2 美元、输出 6 美元;但在 Artificial Analysis 指数和 Terminal-Bench 4.0 上明显落后于 Claude Fable 5.1 与 GPT-6。

  • xAI 发布 Grok 4.7,主打编程与知识工作,定价每百万输入 2 美元、输出 6 美元;但在 Artificial Analysis 指数和 Terminal-Bench 4.0 上明显落后于 Claude Fable 5.1 与 GPT-6。
  • 原贴提到:Elon Musk's xAI has introduced Grok 4.7, its most capable model yet for
  • 来源:the-decoder.com

详细解读

这是什么信号:xAI 以低价和更强编程能力切入模型市场。Grok 4.7 被描述为迄今在编程和知识工作上最强的模型,构建在更大的基础模型上,采用更长强化学习,并设计为更好地验证自身输出。但真正值得关注的不是单项能力宣称,而是“低价+中游基准”的组合:每百万输入 2 美元、输出 6 美元,价格更接近中国模型而非西方前沿模型。

为什么重要:模型竞争正在从单纯比能力,转向能力、价格与分发的组合竞争。Grok 4.7 在独立 Artificial Analysis Intelligence Index(v4.3.2)上得 46 分,处于中游,Claude Fable 5.1 和 GPT-6 以 53 分领先;在更贴近实际开发的 Terminal-Bench 4.0 上,Grok 4.7 仅 26%,低于 GPT-6 Astra 的 60% 和 Claude Fable 5.1 的 55%,甚至略低于更便宜的 DeepSeek V4.1 Flash 的 27%。这说明低价可能是有意用价格换采用率,但能力差距在智能体编程等复杂任务上被放大。

对谁有价值:对开发者、AI 编程工具团队、成本敏感的初创公司和需要批量调用 API 的企业,Grok 4.7 提供了低成本试验选项,可用于草稿生成、代码补全、测试生成、内部知识检索等非关键任务。对模型评测和采购团队,它提供了一个价格锚点和能力下限参照。对 Cursor 等分发平台,多模型接入让用户能按任务切换,降低单一模型依赖。

可以怎么行动:不建议仅凭发布信息替换主力模型。可先做小规模 A/B:把 Grok 4.7 放进低成本任务池,与 Claude、GPT-6、DeepSeek 对比成功率、返工率、token 成本和延迟。重点测自验证输出是否降低幻觉、长上下文代码库任务、终端智能体任务。若已通过 Grok API、Cursor、Grok Build 可用,可先在辅助编码、测试生成、文档问答中试点。采购时把价格、限流、数据合规和可用区域纳入评估。

风险或限制:基准测试不等于生产表现,尤其智能体编程对工具调用、环境稳定性和错误恢复要求高。xAI 的“更大基础模型、更长强化学习、自我验证”目前来自公司说法,需要独立复现。低价可能伴随限流、性能波动或后续调价。若关键任务依赖高准确率,26% 的 Terminal-Bench 成绩是明确警示。模型名称如 Claude Fable 5.1、GPT-6 Astra、DeepSeek V4.1 Flash 均按原文呈现,不额外推断其发布时间或能力细节。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《xAI 低价发布 Grok 4.7,但基准测试显示与 Claude 和 GPT-6 差距明显》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

xAI 低价发布 Grok 4.7,但基准测试显示与 Claude 和 GPT-6 差距明显主要讲什么?

xAI 发布 Grok 4.7,主打编程与知识工作,定价每百万输入 2 美元、输出 6 美元;但在 Artificial Analysis 指数和 Terminal-Bench 4.0 上明显落后于 Claude Fable 5.1 与 GPT-6。

这篇文章最值得关注的要点是什么?

xAI 发布 Grok 4.7,主打编程与知识工作,定价每百万输入 2 美元、输出 6 美元;但在 Artificial Analysis 指数和 Terminal-Bench 4.0 上明显落后于 Claude Fable 5.1 与…;原贴提到:Elon Musk's xAI has introduced Grok 4.7, its most capable model yet for;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「自动化、模型、Claude」等主题信号。;这篇内容命中「Agent、智能体」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 马斯克称 Grok 4.7 使 xAI 在智能体编码领域位列第三 下一篇 字节跳动推出 Dramagic,一个从剧本到成片的短剧全流程 AI 平台