觉
AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-09-12 23 浏览 公开

GPT-6 Astra 早期基准显示空间推理出现“阶跃变化”

一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并透露在未公开的 REMAP 基准上 Astra 准确率接近人类水平。

SOURCE / 全球热点解读 MIN / 9 ACCESS / 公开 POST / 2026-09-12 22:26:09

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

GPT-6 Astra appears to be a big leap forward for spatial reasoning. A new robotics benchmark called StationeryBench pits OpenAI's GPT-6 Astra against Ai2's MolmoAct2 across five desk-object tasks like uncapping a marker, pouring out paper clips, or passing a ruler between two robot arms. Both models controlled the same dual-arm YAM robots across 200 trials. Astra fully completed 7 out of 100 tasks; MolmoAct2 completed zero. Astra's median progress score hit 46 out of 100, MolmoAct2 managed 12. All results, videos, and code are on GitHub . OpenAI has long-term plans to build its own consumer robots . Yoav Artzi , an AI researcher at Cornell and Google DeepMind, calls Astra a "step change in spatial reasoning." On the still-unpublished REMAP benchmark, GPT-Astra reaches accuracy close to human level, though Artzi notes that "even ASTRA doesn't get to what humans do in other scenarios." He suspects OpenAI trained the model on large amounts of 3D data such as Blender scenes. That lines up with Astra's particular improvement on 3D tasks. Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

GPT-6 Astra 在空间推理方面似乎是一次巨大飞跃。

一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在五项桌面物体任务上展开较量,比如打开马克笔笔帽、倒出回形针,或在两个机械臂之间传递一把尺子。

两个模型在 200 次试验中控制相同的双臂 YAM 机器人。

Astra 在 100 项任务中完全完成了 7 项;MolmoAct2 完成了零项。

Astra 的中位进度分数达到 100 分中的 46 分,MolmoAct2 为 12 分。

所有结果、视频和代码都在 GitHub 上。

OpenAI 有打造自己消费级机器人的长期计划。

康奈尔大学和 Google DeepMind 的 AI 研究员 Yoav Artzi 称 Astra 是“空间推理的阶跃变化”。

在尚未发布的 REMAP 基准上,GPT-Astra 的准确率接近人类水平,不过 Artzi 指出,“即便是 ASTRA 在其他场景中也达不到人类的表现。”

他怀疑 OpenAI 用大量 3D 数据训练了该模型,比如 Blender 场景。

这与 Astra 在 3D 任务上的特殊提升相吻合。

订阅 THE DECODER 可享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问以及评论区访问权限。

核心信息

一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并透露在未公开的 REMAP 基准上 Astra 准确率接近人类水平。

  • 一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并透露在未公开的 REMAP 基准上 Astra 准确率接近人类水平。
  • 原贴提到:GPT-6 Astra appears to be a big leap forward for spatial reasoning. A ne
  • 来源:the-decoder.com

详细解读

这是什么信号:一个名为 StationeryBench 的新机器人基准,把 OpenAI 的 GPT-6 Astra 和 Ai2 的 MolmoAct2 放在同一套双臂 YAM 机器人上做 200 次试验,任务包括开笔帽、倒回形针、在两臂间递尺子等五项桌面操作。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。更关键的是,康奈尔与 Google DeepMind 的研究者 Yoav Artzi 将其称为“空间推理的阶跃变化”,并透露在尚未公开的 REMAP 基准上,GPT-Astra 准确率接近人类水平。这不是一次普通跑分,而是大模型开始直接驱动机器人完成精细物理操作的可验证信号。

为什么重要:空间推理长期是语言模型与具身智能之间的断层。过去模型能描述“把尺子递过去”,但很难在真实双臂系统里规划抓取、传递和释放。Astra 的进展如果可复现,意味着通用模型可能绕过专用机器人策略,直接承担部分操作规划。OpenAI 又有自建消费级机器人的长期计划,模型能力与硬件野心正在合流。

对谁有价值:机器人公司、具身智能研究者、自动化集成商、AI 产品负责人和关注 OpenAI 硬件路线的投资人都应关注。尤其是正在评估“用大模型做机器人任务规划”的团队,这个基准提供了少见的同机器人、同任务、同试验次数的对比。

可以怎么行动:先去 GitHub 查看结果、视频和代码,确认任务设置与成功判定;在自己的桌面操作或仓储分拣场景里做小规模复现;关注 3D 数据训练路线,例如 Blender 场景等合成数据是否可迁移;把 REMAP 等未发布基准列入跟踪清单,等公开后再做二次判断。

风险与限制:Astra 完全完成率只有 7/100,说明离稳定可用仍有距离;REMAP 尚未发布,接近人类水平的说法无法独立验证;200 次试验和五项桌面任务样本有限,不能直接外推到通用空间智能;Artzi 也指出 ASTRA 在其他场景中仍达不到人类表现。把基准热度等同于机器人落地能力,是当前最大的误判风险。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《GPT-6 Astra 早期基准显示空间推理出现“阶跃变化”》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

GPT-6 Astra 早期基准显示空间推理出现“阶跃变化”主要讲什么?

一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零;Astra 中位进度 46/100,对手为 12/100。研究者 Yoav Artzi 称这是空间推理的“阶跃变化”,并…

这篇文章最值得关注的要点是什么?

一个名为 StationeryBench 的新机器人基准让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在双臂机器人上执行五项桌面任务。Astra 完全完成 7/100 项任务,MolmoAct2 为零…;原贴提到:GPT-6 Astra appears to be a big leap forward for spatial reasoning. A ne;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容来自该专题长期覆盖的栏目。;这篇内容来自该专题长期覆盖的栏目。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 Sam Altman 表示同意 Dario Amodei 的放缓前沿主张,OpenAI 将同样开放独立评估者访问 下一篇 Dario Amodei 发文呼吁为前沿 AI 降速并提出三点计划