SpaceXAI的Grok 4.6与OpenAI最佳模型持平,价格更低
Grok 4.6在性能和价格上双重突破:AI指数得分61分,追平OpenAI GPT-5.6 Sol,代理任务基准排名第二,定价比Claude Opus 5和GPT-5.6 Sol便宜60%以上,现已在API和Cursor等平台上线。
原贴
查看原文原文
中文翻译
Grok 4.6 追平了前沿模型,但成本低得多。根据 Artificial Analysis Intelligence Index,SpaceXAI 的新模型得分 61 分,与 OpenAI 的 GPT-5.6 Sol 持平。只有 Anthropic 的 Claude Opus 5(63 分)和 Claude Fable 5(62 分)得分更高。这比其前代 Grok 4.5 提升了 5 分。Grok 4.6 在代理任务上表现尤其出色,这类任务中模型需要独立执行多步骤工作流。在旨在衡量计算机上真实世界知识工作的 GDPval-AA v2 基准中,它以 1,753 的 Elo 得分排名第二,仅次于 Claude Opus 5。它完成复杂任务约需 53 步,而 Claude Opus 5 大约需要 103 步。定价保持在每百万 token 2 美元/6 美元。这比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)便宜 60% 以上。Grok 4.6 现已通过 API、Cursor、Grok Build 以及 OpenRouter、Vercel 和 Cloudflare 等合作伙伴提供。第一周内,x.ai 在 Grok Build 和 Cursor 中提供双倍使用配额。
核心信息
Grok 4.6在性能和价格上双重突破:AI指数得分61分,追平OpenAI GPT-5.6 Sol,代理任务基准排名第二,定价比Claude Opus 5和GPT-5.6 Sol便宜60%以上,现已在API和Cursor等平台上线。
- Grok 4.6在性能和价格上双重突破:AI指数得分61分,追平OpenAI GPT-5.6 Sol,代理任务基准排名第二,定价比Claude Opus 5和GPT-5.6 Sol便宜60%以上,现已在API和Cursor等平台上线。
- 原贴提到:Grok 4.6 catches up to frontier models while costing far less. According
- 来源:the-decoder.com
详细解读
这是什么信号?Grok 4.6 的发布标志着开源(或半开放)模型与闭源顶级模型之间的差距正在急剧缩小。以 Artificial Analysis Intelligence Index 衡量的综合能力,Grok 4.6 已与 OpenAI 的旗舰 GPT-5.6 Sol 持平,且在代理任务和真实工作负载上的表现甚至超越部分闭源模型。更重要的是,它保持激进定价,每百万 token 仅 2/6 美元,比 Claude Opus 5 和 GPT-5.6 Sol 便宜超 60%。这说明 SpaceXAI 正在用“高性能+低成本”的组合拳,重新定义 AI 模型的市场竞争格局。
为什么重要?过去,前沿模型通常与高价格绑定,企业只能在成本和性能之间权衡。Grok 4.6 打破了这一惯例,使顶级模型能力首次以超低价格普及。尤其在代理任务上,它用 53 步完成复杂工作,而 Claude Opus 5 需要 103 步,尽管后者得分略高,但实际效率差距巨大。这对依赖 AI 执行多步骤流程的企业来说,意味着更低的等待时间和成本,可能改变 AI 应用的 ROI 计算。同时,它通过 Cursor、Vercel、Cloudflare 等渠道广泛分发,降低了接入门槛,加速了 AI 在各行业的渗透。
对谁有价值?首先是开发者与 AI 创业公司:能以更低成本调用前沿级模型,快速迭代代理应用;其次是中大型企业:在客服、数据分析、自动化流程等场景中,可显著节省推理成本;再次是 AI 研究者:Grok 4.6 的高性价比让实验和基准测试更易开展;最后是 all-in AI 的独立开发者(super-individual),他们可以用此模型构建个人级 Agent,提升个人生产力。
可以怎么行动?建议立即在 Cursor 或 API 上试用 Grok 4.6,将其接入实际业务场景,对比现有模型的输出质量和成本消耗。对于有代理需求的项目,优先测试其在多步任务上的表现。同时,关注 SpaceXAI 的配额优惠(首周双倍),布局个人或团队的工具链。也可将其与 Claude Opus 5 混合使用:复杂推理用 Claude,高频低成本任务用 Grok 4.6,以优化总成本。
风险或限制Grok 4.6 在基准上的得分虽高,但实际生产环境中的可靠性、安全性和合规性尚需验证。低定价可能意味着服务稳定性或支持力度不如大厂,且模型更新速度快,团队需保持跟随。另外,GDPval-AA v2 基准的具体场景覆盖有限,不能代表全部真实工作。最核心的风险是:模型能力追平不等于生态成熟,Grok 的工具链和第三方集成可能不如 OpenAI/Anthropic 丰富。因此,建议先在非关键业务中测试,再逐步扩大部署。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《SpaceXAI的Grok 4.6与OpenAI最佳模型持平,价格更低》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
SpaceXAI的Grok 4.6与OpenAI最佳模型持平,价格更低主要讲什么?
Grok 4.6在性能和价格上双重突破:AI指数得分61分,追平OpenAI GPT-5.6 Sol,代理任务基准排名第二,定价比Claude Opus 5和GPT-5.6 Sol便宜60%以上,现已在API和Cursor等平台上线。
这篇文章最值得关注的要点是什么?
Grok 4.6在性能和价格上双重突破:AI指数得分61分,追平OpenAI GPT-5.6 Sol,代理任务基准排名第二,定价比Claude Opus 5和GPT-5.6 Sol便宜60%以上,现已在API和Cursor等平台上线。;原贴提到:Grok 4.6 catches up to frontier models while costing far less. According;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在Agent工作流、AI工具、AI副业专题里阅读。 关联原因:这篇内容命中「Agent、智能体、Cursor」等主题信号。;这篇内容命中「自动化、模型、Cursor」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。