Knowledge File / AI超级个体
趋势解读:NVIDIA Research 发布 SpatialClaw,讨论数据集与基础模型
NVIDIA Research 推出 SpatialClaw,无需训练即可通过代码接口调用感知工具,提升3D空间推理能力,在20项基准测试中平均准确率达59.9%。
SOURCE / AI超级个体
MIN / 9
ACCESS / 会员
POST / 2026-06-20 06:51:59
原贴
查看原文原文
NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。 AIHOT 分类:ai-products
中文翻译
NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。
核心信息
NVIDIA Research 推出 SpatialClaw,无需训练即可通过代码接口调用感知工具,提升3D空间推理能力,在20项基准测试中平均准确率达59.9%。
- SpatialClaw通过代码接口调用感知工具,无需训练。
- 在20项基准测试中平均准确率59.9%,领先同类方法。
- 支持多种大模型,提示词和工具集可跨模型复用。
- 解决VLM在3D空间判断上的弱点,降低应用门槛。
试看内容
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。
详细解读
信息差价值
参考来源
成为会员查看完整内容