论文

RoboHarn-Evo:不断发展分层物理知识以实现自我改进的机器人操作

RoboHarn-Evo: Evolving Hierarchical Physical Knowledge for Self-Improving Robotic Manipulation

上下文与知识记忆Agent记忆

摘要

视觉语言模型可以协调长视距机器人操作,但成功的任务推理仍然取决于局部物理交互是否产生预期效果。我们研究重复交互如何在不更新基础模型的情况下提高这种能力。我们rollout了 RoboHarn-Evo,这是一种双环Harness,可从物理经验中演化出分层物理知识 (HPK)。 HPK 将两个级别的可重用知识结合起来:任务知识捕获应该执行哪个子任务以及何时完成,而动作知识捕获与对象相关的几何策略及其物理效果。在执行过程中,Agent检索相应决策级别的知识,并将其基于任务目标下的当前场景。在各个情节中,物理反馈用于修改历史知识,更新其适用性,并组织可重复使用的条目以供后续检索。 RMBench 上的实验表明,HPK 将不同代理模型的平均成功率提高了 24.2 个百分点。通过 80 次交互的rollout,GPT-5.5 的保留成功率从 48.3% 上升到 75.0%,GPT-6 的保留成功率从 70.0% 上升到 88.3%。 RoboHarn-Evo 还解决了超过 83% 的历史知识错误,同时保留了 95.8% 的有效知识,并将零样本从 RMBench 转移到 RoboDojo,分别提高了 35.0 和 25.0 个百分点。这些结果表明,物理交互可以积累为可重用的知识,以改进后续操作。

RoboHarn-Evo:不断发展分层物理知识以实现自我改进的机器人操作:图1:通过分层知识演化实现机器人操作的自我改进。(a)有序积木操作中,机器人可能在完成当前子任务前转向下一块积木(上),或选择正确目标却将盖子释放到目标之外(下)。(b)保持VLM与执行器固定,利用物理反馈跨回合更新任务知识和动作知识。(c)80次rollout后,知识演化将未见模拟任务成功率提高18.3至26.7个百分点。模拟中获得的知识在现实任务中达到41.7%的平均零样本成功率,继续通过现实交互更新知识后提高至62.5%。
图1:通过分层知识演化实现机器人操作的自我改进。(a)有序积木操作中,机器人可能在完成当前子任务前转向下一块积木(上),或选择正确目标却将盖子释放到目标之外(下)。(b)保持VLM与执行器固定,利用物理反馈跨回合更新任务知识和动作知识。(c)80次rollout后,知识演化将未见模拟任务成功率提高18.3至26.7个百分点。模拟中获得的知识在现实任务中达到41.7%的平均零样本成功率,继续通过现实交互更新知识后提高至62.5%。