中国Orca世界模型无需动作标签即可匹敌专业机器人系统
北京智源人工智能研究院发布Orca世界基础模型,通过无动作标签训练,在五个机器人任务上达到专业系统水平,有望解决机器人数据长期短缺问题。
原贴
查看原文原文
中文翻译
北京智源人工智能研究院(BAAI)发布了Orca,一个“世界基础模型”,它打破了当今AI的主流方法。Orca不是预测下一个令牌、下一帧视频或下一个机器人动作,而是在一个抽象的内部表示中对世界的下一个状态进行建模。
根据技术报告,智能不应被语言模型、视频生成器或机器人控制器等专门的预测模型所定义。该团队认为,需要的是能够建立对世界变化的一般理解,并将其作为许多不同任务基础的模型。
Orca结合了两种学习模式。“无意识学习”使用没有任何字幕的原始视频。模型看到一张图像,并预测下一张图像会是什么样子,不是像素级别,而是在一个抽象空间中,从而学习运动模式、遮挡和典型的场景动态。“有意识学习”则添加了语言指令。视频被分割成片段,每个片段都标有状态变化的描述,这样模型就能学习特定动作发生时状态如何转变。它还训练经典的视频问答任务,以便仍能响应自然语言查询。
预训练的语言-图像模型Qwen3.5作为基础,训练后核心保持冻结。对于每种输出类型,研究人员附加一个单独的、更小的模块,将内部状态转换为所需形式。文本通过Qwen3.5现有的语言头输出。对于图像,Stable Diffusion 3.5也保持不变,只训练小型上游适配器将Orca的内部状态传递给图像生成器。机器人动作来自一个从头训练的“Action Expert”控制模块。这种分离是有意为之,因为团队表示他们并非在单一基准上追求最高分,而是想展示一个训练良好的内部世界状态可以作为不同任务的共享基础。
在训练中,研究人员汇集了12.5万小时的视频素材、1.6亿个事件描述和1150万个问答对。视频涵盖四个视角,包括日常交互的第一人称镜头、物体操作的第三人称镜头、无动作数据的机器人记录以及自然场景。只有十分之一的视频数据用于当前版本。Orca训练了两种规模,参数分别为0.8亿和40亿。训练损失随着更多数据和更大模型稳步下降,早期测试也表明预训练中内部世界状态越好,所有三种输出模式的结果也越好。
在文本基准上,Orca-4B在MVBench、TemporalBench、3DSRBench和SWITCH上的平均最佳成绩为51.8%,超过了所比较的小型VLM和更大的世界模型。虽然它没有赢得每一个单项测试(例如Qwen3.5-4B在MVBench上领先),但平均得分优于Qwen3.5-4B、Gemma 4-4B和DeepSeek-VL2-3B等多个VLM基线。Orca-4B在平均得分上也超过了更大的世界模型Emu3(8B)和Emu3.5(34B)。
对于图像预测,研究人员建立了自己的基准PRICE-V0.1,使用真实世界机器人和第一人称场景,要求模型生成如“关闭微波炉”等命令的结果图像。Orca-4B平均得分59.8%,超过了专门的图像生成器如FLUX.2 small(56.1%)、FLUX.1-context(40.9%)和OmniGen2(39.6%)。Orca在保持机器人形状、物体接触点和指令链接方面优于纯图像模型,后者常常添加无关物体或幻觉的手部。
在五个操控任务中,使用...
核心信息
北京智源人工智能研究院发布Orca世界基础模型,通过无动作标签训练,在五个机器人任务上达到专业系统水平,有望解决机器人数据长期短缺问题。
- 北京智源人工智能研究院发布Orca世界基础模型,通过无动作标签训练,在五个机器人任务上达到专业系统水平,有望解决机器人数据长期短缺问题。
- 原贴提到:BAAI's Orca world model matches the performance of specialized systems a
- 来源:the-decoder.com
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。