论文
APEX:用于精确操纵的自适应策略执行
APEX: Adaptive Policy Execution for Precise Manipulation
摘要
现代模仿学习方法,包括视觉运动和视觉语言动作(VLA)策略,通常输出由底层控制器执行的高级动作参考。然而,缺乏高阶参考信号,加上策略在训练过程中缺乏对潜在底层控制动态的认识,不可避免地会导致执行差距。结果,已实现的行动系统性地偏离了政策命令的行动,对精确敏感的操纵产生了重大影响。先前的工作要么修改策略架构,要么修改底层控制器,两者都需要对预训练策略或打包控制器进行侵入式更改。这就提出了一个自然的问题:当策略和控制器都被视为不可访问的黑匣子时,我们能否弥合执行差距?我们提出了自适应策略执行(APEX),这是一种插入策略和控制器之间的即插即用框架,它从策略输出中重建动态可行的参考,并根据低级状态反馈在测试时进行调整,并具有可证明的收敛保证。广泛的实证研究表明,APEX 在演示回放中将控制器引起的跟踪误差降低了 41.2%,并将四个视觉运动和 VLA 策略类别的操纵成功率提高了 4.8--25.8 个百分点。