GPT-6 Astra 早期基准显示空间推理出现“阶跃变化”
一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并透露在未公开的 REMAP 基准上 Astra 准确率接近人类水平。
原贴
查看原文原文
中文翻译
GPT-6 Astra 在空间推理方面似乎是一次巨大飞跃。
一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在五项桌面物体任务上展开较量,比如打开马克笔笔帽、倒出回形针,或在两个机械臂之间传递一把尺子。
两个模型在 200 次试验中控制相同的双臂 YAM 机器人。
Astra 在 100 项任务中完全完成了 7 项;MolmoAct2 完成了零项。
Astra 的中位进度分数达到 100 分中的 46 分,MolmoAct2 为 12 分。
所有结果、视频和代码都在 GitHub 上。
OpenAI 有打造自己消费级机器人的长期计划。
康奈尔大学和 Google DeepMind 的 AI 研究员 Yoav Artzi 称 Astra 是“空间推理的阶跃变化”。
在尚未发布的 REMAP 基准上,GPT-Astra 的准确率接近人类水平,不过 Artzi 指出,“即便是 ASTRA 在其他场景中也达不到人类的表现。”
他怀疑 OpenAI 用大量 3D 数据训练了该模型,比如 Blender 场景。
这与 Astra 在 3D 任务上的特殊提升相吻合。
订阅 THE DECODER 可享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问以及评论区访问权限。
核心信息
一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并透露在未公开的 REMAP 基准上 Astra 准确率接近人类水平。
- 一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并透露在未公开的 REMAP 基准上 Astra 准确率接近人类水平。
- 原贴提到:GPT-6 Astra appears to be a big leap forward for spatial reasoning. A ne
- 来源:the-decoder.com
详细解读
这是什么信号:一个名为 StationeryBench 的新机器人基准,把 OpenAI 的 GPT-6 Astra 和 Ai2 的 MolmoAct2 放在同一套双臂 YAM 机器人上做 200 次试验,任务包括开笔帽、倒回形针、在两臂间递尺子等五项桌面操作。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。更关键的是,康奈尔与 Google DeepMind 的研究者 Yoav Artzi 将其称为“空间推理的阶跃变化”,并透露在尚未公开的 REMAP 基准上,GPT-Astra 准确率接近人类水平。这不是一次普通跑分,而是大模型开始直接驱动机器人完成精细物理操作的可验证信号。
为什么重要:空间推理长期是语言模型与具身智能之间的断层。过去模型能描述“把尺子递过去”,但很难在真实双臂系统里规划抓取、传递和释放。Astra 的进展如果可复现,意味着通用模型可能绕过专用机器人策略,直接承担部分操作规划。OpenAI 又有自建消费级机器人的长期计划,模型能力与硬件野心正在合流。
对谁有价值:机器人公司、具身智能研究者、自动化集成商、AI 产品负责人和关注 OpenAI 硬件路线的投资人都应关注。尤其是正在评估“用大模型做机器人任务规划”的团队,这个基准提供了少见的同机器人、同任务、同试验次数的对比。
可以怎么行动:先去 GitHub 查看结果、视频和代码,确认任务设置与成功判定;在自己的桌面操作或仓储分拣场景里做小规模复现;关注 3D 数据训练路线,例如 Blender 场景等合成数据是否可迁移;把 REMAP 等未发布基准列入跟踪清单,等公开后再做二次判断。
风险与限制:Astra 完全完成率只有 7/100,说明离稳定可用仍有距离;REMAP 尚未发布,接近人类水平的说法无法独立验证;200 次试验和五项桌面任务样本有限,不能直接外推到通用空间智能;Artzi 也指出 ASTRA 在其他场景中仍达不到人类表现。把基准热度等同于机器人落地能力,是当前最大的误判风险。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《GPT-6 Astra 早期基准显示空间推理出现“阶跃变化”》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
GPT-6 Astra 早期基准显示空间推理出现“阶跃变化”主要讲什么?
一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并…
这篇文章最值得关注的要点是什么?
一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零…;原贴提到:GPT-6 Astra appears to be a big leap forward for spatial reasoning. A ne;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容来自该专题长期覆盖的栏目。;这篇内容来自该专题长期覆盖的栏目。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。