论文
RoboAware:学习从反事实结果中协调具体技能
RoboAware: Learning to Coordinate Embodied Skills from Counterfactual Outcomes
摘要
体现的编码代理可以将模块化机器人技能与冻结的端到端策略相结合,但有效的组合需要预测哪个策略系列将在当前的物理状态下取得成功。我们提出了 RoboAware,它通过仅从反事实结果中学习状态条件的责任协调器,建立在编码代理的技能编排之上。受到 REPL 成功的启发,我们提出了 $P^5$ 模式,并基于它制定了分层 MDP。 $P^5$ 将技能统一组织为五个语义阶段,定义了可以比较责任的位置。为了解决现有工作中缺乏反事实分支结果的问题,我们引入了状态锁定反事实分支(SCB),它恢复相同的训练状态以生成和执行来自每个可接受系列的代码块,从而暴露选定分支经验未观察到的结果。在此基础上,我们提出了执行感知学习(EAL),它将蒙特卡罗树搜索与 Q 学习相结合,将这些结果提炼为家庭条件值。部署时,协调器选择 根据可观察的上下文确定策略族,并且冻结编码代理生成下一个本地代码块。对 100 项任务的全面单集评估表明,RoboAware 的总体成功率达到 77.0%,在 RoboSuite 上的 SOTA 平均成功率为 90.0%,在不同的 LIBERO-Pro 任务集群上为 73.8%,在具有挑战性的 RoboTwin 双手任务上为 90.0%,优于现有的代码即策略和 VLA-harness 基线。