论文
经由 Retrieve-Reason-Act 的检索增强机器人
Retrieval-Augmented Robots via Retrieve-Reason-Act
摘要
为达成通用效用,我们主张机器人必须从被动执行者进化为主动的信息检索用户。在没有先验演示的严格零样本场景中,机器人面临关键信息缺口——例如组装复杂家具套件所需的确切顺序——内部参数知识(常识)或过往内部记忆都无法满足。虽然近期机器人工作尝试行动前搜索,但主要聚焦检索过往运动学轨迹(类似搜内部记忆)或文本安全规则(搜约束)。这些方法未能满足主动任务构建的核心信息需求:从外部非结构化文档获取未见过的程序性知识。本文将该范式定义为检索增强机器人(RAR),赋予机器人连接视觉文档与物理执行的信息获取能力。我们把任务执行形式化为迭代的 Retrieve-Reason-Act 循环:机器人或具身智能体主动从非结构化语料检索相关视觉程序手册,经跨模态对齐把抽象 2D 图对接到 3D 物理零件,并合成可执行计划。我们在一个有挑战性的长程装配基准上验证该范式。实验表明,把机器人规划建立在检索到的视觉文档显著优于依赖零样本推理或少样本示例检索的基线。这项工作确立 RAR 的基础,把信息检索的范围从回答用户查询扩展到驱动具身物理动作。
