Anthropic的Opus 5在衡量真实智能的基准测试中大幅超越Fable 5和GPT-5.6 Sol
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。
原贴
查看原文原文
中文翻译
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队将这一领先归因于真正更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出此前AI模型从未出现过的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。
ARC-AGI基准的创建者表示,Anthropic的Claude Opus 5在ARC-AGI-3上的巨大领先源于真正更好的推理能力。该模型在ARC-AGI-3上得分30.2%,成为新领先者。此前的纪录是OpenAI GPT-5.6 Sol(Max)创下的7.8%。Opus 5解决了五个此前未解决的环境,其中四个达到或超过人类水平。这也使其领先于Anthropic的“Fable-class”模型,后者据ARC Prize得分约为20%。ARC Prize的分析将领先归因于更强的逻辑推理能力,“这使其能够在陌生环境中进行更自主的探索、规划和执行。”测试中,Opus 5还表现出研究人员此前从未见过的行为。它首次将任务转化为代数符号,并独立构建反射方程。
25个公开演示环境中的六个现已得到解决。完整结果、回放和基准测试代码已公开。在较旧的ARC-AGI-2基准上,Opus 5得分为90.4%,在ARC-AGI-1上达到97.5%。据ARC Prize,两项结果均与之前最高分持平,但成本略高。
ARC-AGI-3衡量AI模型解决训练中未遇到的新任务的能力,包括人类通常能轻松处理的任务。当前版本如同游戏。模型必须推断交互环境的规则,规划行动,并逐步执行。这测试的是通用推理而非存储的知识。一些AI系统可能已经通过了基准,但它们依赖称为“harness”的外部软件。官方得分仅计入语言模型自身的表现。ARC Prize认为,未来的AGI系统不应需要外部帮助来解决新任务。如果在Claude Code中使用,Opus 5的得分可能会更高。
Anthropic尚未解释这一进步,但定向数据标注和强化学习是可能的因素。与早期模型不同,Opus 5是在ARC-AGI-3及其格式公开后开发的。这可能让Anthropic定位基准的技能和谜题格式,尽管并未显示该公司在确切任务上训练。标注者可能标记了类似谜题的推理轨迹、有用行为、失败尝试和恢复步骤。强化学习随后可能奖励探索、规划、规则发现和自纠错。
在Witness(广汉宁的交互式谜题游戏私有基准)上的测试指向更窄的进步。Opus 5得分为43.4,与Kimi K3和Fable 5统计上持平,相比Opus 4.8的提升远小于其在ARC-AGI-3上的提升。在一个围绕常见机制构建的谜题上,Opus 5在首次行动前就陈述了隐藏规则。但当游戏以不太熟悉的方式组合规则时,其得分低于Opus 4.8。宁表示,这种模式符合在特定类型数据上的训练,尽管Witness无法识别Anthropic使用了哪些数据。
ARC-AGI-3的研究者之一Greg Kamradt表示,结果并不排除更广泛的推理进步。传统谜题可能无法测试新颖性,因为它使用熟悉的机制,而在一个不寻常游戏上的较弱表现可能是孤立的回归。Kamradt指出,尽管Opus 4.8在总体上大幅落后于Opus 5,但在某些ARC-AGI-3游戏上其表现仍优于Opus 5。
核心信息
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。
- Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方程,同时解决了五个此前未被解决的测试环境。
- 原贴提到:Anthropic's Claude Opus 5 scored 30.2 percent on the ARC-AGI-3 benchmark
- 来源:the-decoder.com
详细解读
信号解读:ARC-AGI-3是一个专门设计来衡量AI模型面对新任务时泛化推理能力的基准,强调“真实智能”而非记忆或模式匹配。Claude Opus 5取得30.2%的成绩,是此前最好成绩(GPT-5.6 Sol的7.8%)的近四倍,这是一个数量级意义上的跃升。该基准的维护方ARC Prize将这一飞跃明确归因于“更强的逻辑推理能力”,而非简单的数据扩展或计算量堆叠。更重要的是,模型在测试中出现了前所未有的行为:将任务转化为代数符号、独立构建反射方程,以及自主解决多个此前所有模型都未能解决的环境。这些行为表明,当前的大语言模型可能正在从“统计学习”向“形式化推理”演进,而这正是通向通用人工智能(AGI)的关键一步。
为什么重要:这一信号的重要性在于,它打破了“AI能力提升主要靠数据和算力”的固有认知。Opus 5的领先并非来自更大的模型规模(Anthropic未公布具体参数),而是在推理机制上发生了结构性变化。此外,该模型是在ARC-AGI-3基准公开之后开发的,这意味着它可能受到基准格式的“定向训练”(尽管没有在确切任务上训练)。这引发了关于基准有效性、泛化能力与过度拟合的深层讨论。如果真实推理能力真的跃升了,将直接影响AI的下游应用——从自动化编程到科学发现。但如果是针对基准格式的过拟合,则其实际泛化能力可能被高估。
对谁有价值:这个信号对三类人直接有价值。第一,AI产品研发者,特别是做智能体(agent)和自动化决策的企业,因为更强的推理和规划能力直接决定了复杂任务的完成度。第二,投资者和行业观察者,因为领先技术可能意味着商业价值的迁移,尤其是Anthropic在推理能力上突然拉开差距,可能改变竞争格局。第三,研究者,因为ARC Prize公开了完整结果、回放和代码,这提供了可复现的研究素材。
可以怎么行动:首先,AI产品团队可以立即申请访问Claude Opus 5的API,在真实业务场景中测试其推理能力,特别是那些需要多步规划、逻辑转换和未知环境探索的任务。其次,企业可以使用ARC-AGI-3公开的基准代码,建立内部评测体系,评估各个模型的真实泛化能力,而不是只看排行榜分数。再次,关注Anthropic后续的技术报告或论文,了解其训练方法——如果定向数据标注和强化学习是原因,那么其他团队也可以借鉴这一方法论。最后,对于那些在交互式谜题任务上依赖AI的团队,可以对比Opus 5与Opus 4.8的差异,注意在“不熟悉规则组合”场景下可能出现的性能回退,并设计相应的兜底方案。
风险与限制:第一,ARC-AGI-3的30.2%虽然大幅领先,但仍然远未达到人类水平(人类通常可轻松解决大多数任务),因此说“AGI即将到来”为时尚早。第二,ARC Prize本身在评估中承认,官方得分只计入模型自身的性能,但如果在Claude Code等外部工具配合下,分数会更高,而实际应用往往离不开工具,这暗示单纯的模型能力可能被低估,也可能被高估。第三,存在“基准过拟合”的嫌疑:由于Opus 5是在ARC-AGI-3格式公开后开发的,可能针对性地优化了该基准的谜题类型。在Witness私有基准上,Opus 5相对Opus 4.8的提升幅度远小于在ARC-AGI-3上的提升,且在一个组合规则的谜题上甚至退步,这说明其泛化能力可能并不均衡。第四,Anthropic未解释提升来源,可复现性和透明度不足。因此,我们应该把这一结果视为“强推理能力的证据”,而不是“结束一切争论的定论”。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《Anthropic的Opus 5在衡量真实智能的基准测试中大幅超越Fable 5和GPT-5.6 Sol》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
Anthropic的Opus 5在衡量真实智能的基准测试中大幅超越Fable 5和GPT-5.6 Sol主要讲什么?
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索和规划。测试中,Opus 5表现出前所未有的行为,包括将任务转化为代数符号并独立构建反射方…
这篇文章最值得关注的要点是什么?
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中得分30.2%,是OpenAI GPT-5.6 Sol(Max)此前创下的7.8%纪录的近四倍。ARC Prize团队认为,这一领先源于更强的逻辑推理能力,使其能…;原贴提到:Anthropic's Claude Opus 5 scored 30.2 percent on the ARC-AGI-3 benchmark;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、AI内容增长专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型、Claude」等主题信号。;这篇内容命中「转化」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。