论文

通过任务结构的物理感知重新配置进行推理时机器人行为指导

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure

摘要

部署学习的机器人策略的一个核心挑战是推理时行为引导:在测试时重定向策略以满足训练期间未预期的用户偏好,而无需重新训练。现有方法在两种模式下失败:端到端方法需要 微调 或专家级​​指导,而神经符号方法依赖于预定义符号,其编辑可以产生逻辑上合理但物理上不可行的计划。为了应对这一挑战,我们提出了 ReStruct,它建立在神经自动机策略的基础上,将视觉运动策略分解为捕获任务结构的高级状态机骨架和表示为残差策略的底层连续控制器。具体来说,ReStruct采用自动机来表示偏好,并通过同步产品将其合并到骨架中,从而重新配置任务结构。在控制器保持冻结的情况下,骨架提供的动作先验会相应更新,以在修改后的任务结构下实现物理感知控制。来自模拟和现实世界的大量实验表明,ReStruct 可以引导广泛的偏好,从以对象为中心的规范到时间逻辑约束,并且在引导超越现有方法后,在任务成功和偏好跟随方面超过 VLA 模型高达 25%。