觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-07-26 4 浏览 免费阅读

Anthropic的Opus 5在衡量真实智能的基准测试中大幅超越Fable 5和GPT-5.6 Sol

Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-07-26 17:43:02

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Anthropic's Claude Opus 5 scored 30.2 percent on the ARC-AGI-3 benchmark, nearly four times the previous record of 7.8 percent set by OpenAI's GPT-5.6 Sol (Max). The ARC Prize team attributes the lead to genuinely stronger logical reasoning that enables more autonomous exploration and planning in unfamiliar environments. During testing, Opus 5 displayed behavior not previously seen from an AI model, including translating tasks into algebraic notation and independently formulating reflection equations, while also solving five previously unsolved environments. The creators of the ARC-AGI benchmark say Anthropic's Claude Opus 5 owes its massive lead on ARC-AGI-3 to genuinely better reasoning. The model scored 30.2 percent on ARC-AGI-3, making it the new leader. The previous record was 7.8 percent, set by OpenAI's GPT-5.6 Sol (Max). Opus 5 solved five previously unsolved environments, four of them at or above human level. That also puts it ahead of Anthropic's "Fable-class" models, which hit around 20 percent according to ARC Prize. ARC Prize's analysis credits the lead to stronger logical reasoning, "which enables more autonomous exploration, planning, and execution across unfamiliar environments." During testing, Opus 5 also showed behavior that researchers hadn't seen from a model before. It translated tasks into algebraic notation and independently formulated reflection equations for the first time. Ad Six of the 25 public demo environments have now been solved. The full results , replays , and benchmarking code are publicly available. On the older ARC-AGI-2 benchmark , Opus 5 scores 90.4 percent, and it reaches 97.5 percent on ARC-AGI-1. Both results match previous top scores, though at slightly higher costs, according to ARC Prize. Ad DEC_D_Incontent-1 ARC-AGI-3 measures how well AI models solve new tasks they didn't encounter during training, including ones humans can usually handle with ease. The current version works like a game. The model must infer the rules of an interactive environment, plan its actions, and carry them out step by step. This tests general reasoning rather than stored knowledge. Some AI systems may have already passed the benchmark, but they rely on extra software known as a harness . Official scores count only the language model's own performance. ARC Prize argues that future AGI systems shouldn't need outside help to solve new tasks. Opus 5 would likely score even higher if used within Claude Code. Ad Anthropic hasn't explained the gain, but targeted data labeling and reinforcement learning are plausible factors. Unlike earlier models, Opus 5 was developed after ARC-AGI-3 and its format became public. That may have let Anthropic target the benchmark's skills and puzzle formats, though it doesn't show the company trained on the exact tasks. Annotators could have labeled reasoning traces, useful actions, failed attempts, and recovery steps from similar puzzles. Reinforcement learning could then reward exploration, planning, rule discovery, and self-correction. Tests on Witness , Guanghan Ning's private benchmark for interactive puzzle games, point to narrower gains. Opus 5 scored 43.4, statistically tying Kimi K3 and Fable 5 while improving far less over Opus 4.8 than it did on ARC-AGI-3. On a puzzle built around common mechanics, Opus 5 stated the hidden rules before making its first move. But when a game combined rules in a less familiar way, it scored below Opus 4.8. Ning says that pattern fits training on genre-specific data, though Witness can't identify what data Anthropic used. Ad DEC_D_Incontent-2 Greg Kamradt, one of the researchers behind ARC-AGI-3 , said the results don't rule out broader reasoning gains. The conventional puzzle may not test novelty because it uses familiar mechanics, while weaker performance on one unusual game could be an isolated regression. Kamradt noted that Opus 4.8 also outperformed Opus 5 on some ARC-AGI-3 games despite trailing it by a wide margin overall

中文翻译

Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队将这一领先归因于真正更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出此前AI模型从未出现过的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。

ARC-AGI基准的创建者表示,Anthropic的Claude Opus 5在ARC-AGI-3上的巨大领先源于真正更好的推理能力。该模型在ARC-AGI-3上得分30.2%,成为新领先者。此前的纪录是OpenAI GPT-5.6 Sol(Max)创下的7.8%。Opus 5解决了五个此前未解决的环境,其中四个达到或超过人类水平。这也使其领先于Anthropic的“Fable-class”模型,后者据ARC Prize得分约为20%。ARC Prize的分析将领先归因于更强的逻辑推理能力,“这使其能够在陌生环境中进行更自主的探索、规划和执行。”测试中,Opus 5还表现出研究人员此前从未见过的行为。它首次将任务转化为代数符号,并独立构建反射方程。

25个公开演示环境中的六个现已得到解决。完整结果、回放和基准测试代码已公开。在较旧的ARC-AGI-2基准上,Opus 5得分为90.4%,在ARC-AGI-1上达到97.5%。据ARC Prize,两项结果均与之前最高分持平,但成本略高。

ARC-AGI-3衡量AI模型解决训练中未遇到的新任务的能力,包括人类通常能轻松处理的任务。当前版本如同游戏。模型必须推断交互环境的规则,规划行动,并逐步执行。这测试的是通用推理而非存储的知识。一些AI系统可能已经通过了基准,但它们依赖称为“harness”的外部软件。官方得分仅计入语言模型自身的表现。ARC Prize认为,未来的AGI系统不应需要外部帮助来解决新任务。如果在Claude Code中使用,Opus 5的得分可能会更高。

Anthropic尚未解释这一进步,但定向数据标注和强化学习是可能的因素。与早期模型不同,Opus 5是在ARC-AGI-3及其格式公开后开发的。这可能让Anthropic定位基准的技能和谜题格式,尽管并未显示该公司在确切任务上训练。标注者可能标记了类似谜题的推理轨迹、有用行为、失败尝试和恢复步骤。强化学习随后可能奖励探索、规划、规则发现和自纠错。

在Witness(广汉宁的交互式谜题游戏私有基准)上的测试指向更窄的进步。Opus 5得分为43.4,与Kimi K3和Fable 5统计上持平,相比Opus 4.8的提升远小于其在ARC-AGI-3上的提升。在一个围绕常见机制构建的谜题上,Opus 5在首次行动前就陈述了隐藏规则。但当游戏以不太熟悉的方式组合规则时,其得分低于Opus 4.8。宁表示,这种模式符合在特定类型数据上的训练,尽管Witness无法识别Anthropic使用了哪些数据。

ARC-AGI-3的研究者之一Greg Kamradt表示,结果并不排除更广泛的推理进步。传统谜题可能无法测试新颖性,因为它使用熟悉的机制,而在一个不寻常游戏上的较弱表现可能是孤立的回归。Kamradt指出,尽管Opus 4.8在总体上大幅落后于Opus 5,但在某些ARC-AGI-3游戏上其表现仍优于Opus 5。

核心信息

Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。

  • Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。
  • 原贴提到:Anthropic's Claude Opus 5 scored 30.2 percent on the ARC-AGI-3 benchmark
  • 来源:the-decoder.com

详细解读

信号解读:ARC-AGI-3是一个专门设计来衡量AI模型面对新任务时泛化推理能力的基准,强调“真实智能”而非记忆或模式匹配。Claude Opus 5取得30.2%的成绩,是此前最好成绩(GPT-5.6 Sol的7.8%)的近四倍,这是一个数量级意义上的跃升。该基准的维护方ARC Prize将这一飞跃明确归因于“更强的逻辑推理能力”,而非简单的数据扩展或计算量堆叠。更重要的是,模型在测试中出现了前所未有的行为:将任务转化为代数符号、独立构建反射方程,以及自主解决多个此前所有模型都未能解决的环境。这些行为表明,当前的大语言模型可能正在从“统计学习”向“形式化推理”演进,而这正是通向通用人工智能(AGI)的关键一步。

为什么重要:这一信号的重要性在于,它打破了“AI能力提升主要靠数据和算力”的固有认知。Opus 5的领先并非来自更大的模型规模(Anthropic未公布具体参数),而是在推理机制上发生了结构性变化。此外,该模型是在ARC-AGI-3基准公开之后开发的,这意味着它可能受到基准格式的“定向训练”(尽管没有在确切任务上训练)。这引发了关于基准有效性、泛化能力与过度拟合的深层讨论。如果真实推理能力真的跃升了,将直接影响AI的下游应用——从自动化编程到科学发现。但如果是针对基准格式的过拟合,则其实际泛化能力可能被高估。

对谁有价值:这个信号对三类人直接有价值。第一,AI产品研发者,特别是做智能体(agent)和自动化决策的企业,因为更强的推理和规划能力直接决定了复杂任务的完成度。第二,投资者和行业观察者,因为领先技术可能意味着商业价值的迁移,尤其是Anthropic在推理能力上突然拉开差距,可能改变竞争格局。第三,研究者,因为ARC Prize公开了完整结果、回放和代码,这提供了可复现的研究素材。

可以怎么行动:首先,AI产品团队可以立即申请访问Claude Opus 5的API,在真实业务场景中测试其推理能力,特别是那些需要多步规划、逻辑转换和未知环境探索的任务。其次,企业可以使用ARC-AGI-3公开的基准代码,建立内部评测体系,评估各个模型的真实泛化能力,而不是只看排行榜分数。再次,关注Anthropic后续的技术报告或论文,了解其训练方法——如果定向数据标注和强化学习是原因,那么其他团队也可以借鉴这一方法论。最后,对于那些在交互式谜题任务上依赖AI的团队,可以对比Opus 5与Opus 4.8的差异,注意在“不熟悉规则组合”场景下可能出现的性能回退,并设计相应的兜底方案。

风险与限制:第一,ARC-AGI-3的30.2%虽然大幅领先,但仍然远未达到人类水平(人类通常可轻松解决大多数任务),因此说“AGI即将到来”为时尚早。第二,ARC Prize本身在评估中承认,官方得分只计入模型自身的性能,但如果在Claude Code等外部工具配合下,分数会更高,而实际应用往往离不开工具,这暗示单纯的模型能力可能被低估,也可能被高估。第三,存在“基准过拟合”的嫌疑:由于Opus 5是在ARC-AGI-3格式公开后开发的,可能针对性地优化了该基准的谜题类型。在Witness私有基准上,Opus 5相对Opus 4.8的提升幅度远小于在ARC-AGI-3上的提升,且在一个组合规则的谜题上甚至退步,这说明其泛化能力可能并不均衡。第四,Anthropic未解释提升来源,可复现性和透明度不足。因此,我们应该把这一结果视为“强推理能力的证据”,而不是“结束一切争论的定论”。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Anthropic的Opus 5在衡量真实智能的基准测试中大幅超越Fable 5和GPT-5.6 Sol》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

Anthropic的Opus 5在衡量真实智能的基准测试中大幅超越Fable 5和GPT-5.6 Sol主要讲什么?

Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方…

这篇文章最值得关注的要点是什么?

Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能…;原贴提到:Anthropic's Claude Opus 5 scored 30.2 percent on the ARC-AGI-3 benchmark;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI副业、AI工具、AI内容增长专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型、Claude」等主题信号。;这篇内容命中「转化」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 Cursor 的智能体集群表明,当前沿模型规划工作时,更便宜的模型可以处理大部分编码 下一篇 马斯克:可直接与 Grok Build 对话
北竹游乐场 免费玩小游戏 免费玩