论文
AnchorRefine:基于轨迹锚点和残差细化的视觉-语言-动作模型协同操纵
AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models
摘要
精度关键的操纵需要全局轨迹组织和本地执行校正,但大多数视觉语言动作(VLA)策略在单个统一空间内生成动作。这种单一的公式迫使宏观层面的传输和微观层面的细化在同一目标下进行优化,导致大运动主导学习,同时抑制小但对故障至关重要的纠正信号。相比之下,人类操纵是通过全局运动规划以及执行过程中持续的局部调整来构建的。受这一原则的启发,我们提出了 AnchorRefine,这是一个分层框架,它将 VLA 动作建模分解为轨迹锚点和残差细化。锚点规划器预测粗略的运动支架,而细化模块则纠正执行级别偏差以提高几何和接触精度。我们进一步引入了决策感知的夹具细化机制,以更好地捕获夹具控制的离散和边界敏感性质。对 LIBERO、CALVIN 和真实机器人任务的实验表明,AnchorRefine 持续改进基于回归和基于扩散的 VLA 主干,使模拟成功率提高高达 7.8%,使现实世界成功率提高 18%。