论文

ARC:机器人基础模型的推理方法

ARC: A Reasoning Recipe for Robot Foundation Models

模型训练模型推理监督微调与指令调优合成数据推理策略与问题分解

摘要

改进机器人基础模型(RFM)的主流方法依赖于更大的模型、更多的机器人演示以及昂贵的大规模培训。我们证明存在一种有效且高效的补充方法:正确的推理方法可以显着提高现有最先进 RFM 的零样本任务性能。我们将此配方称为 ARC。它由三个关键要素组成:推理轨迹、可扩展的自动标记管道以及调整预训练 RFM 以使用这些轨迹进行控制的策略。首先,我们发现有效的推理痕迹应该扎根于机器人的下一个动作,并解释其因果结构:为什么该动作是适当的以及它应该产生什么效果。其次,我们展示了这些跟踪可以从现有演示中自动生成,使我们能够从 DROID 构建 ARC-Trace-DROID,而无需收集新的机器人数据。第三,我们展示了最先进的 VLA(例如 $π_{0.5}$)和 WAM(例如 Cosmos3-Nano-Policy)如何通过微调和推理来学习使用这些跟踪进行控制 根据每个模型的架构和功能进行定制。使用 ARC,我们获得了零样本 RFM 性能的提升,据我们所知,在没有额外的机器人演示或基础规模培训的情况下,这是前所未有的。改编后的模型在 RoboLab-120 和 MolmoSpaces 上建立了新的技术水平,在 RoboLab-Reasoning-50 上提高了高达 50 个百分点。在真实的机器人上,ARC 将 $π_{0.5}$ 的任务成功率提高了 82.2 个百分点。项目网站:https://arc-robot-reasoning.github.io/