论文
ForceRFT:通过力引导残差强化学习完善 VLA 动作
ForceRFT: Refining VLA Actions through Force-Guided Residual Reinforcement Learning
摘要
强制调节的视觉语言动作(VLA)策略可以对接触做出反应,但当仅进行演示训练时,它们的恢复行为可能会受到演示覆盖范围的限制,并且它们不会从部署结果中学习。人类纠正性模仿提供了额外的恢复示例,但其目标与本地行动目标相匹配,而没有明确优化任务返回。我们提出了 ForceRFT,一种力引导的残差强化学习框架,可以从人类监督和自主任务结果中学习依赖于接触的修正。一个冻结的、经过演示训练的基于 SmolVLA 的先验生成力条件动作块,而一个轻量级剩余 actor 使用块执行期间获取的手腕反馈来完善各个末端执行器姿势命令。决策时间手腕扳手、其时间变化以及所选的基本运动条件残差校正和值估计。人工修正监督剩余参与者,而经过验证的自主转换则训练孪生批评者并支持对同一参与者的价值引导更新。自举仅限于自治部分,防止道明信贷跨越人为干预的界限。关于插头插入、挂环组装和白板擦拭的真实机器人实验显示,与评估的演示训练和残留模仿基线相比,其自主成功率更高。与残余模仿的比较支持价值引导的残余优化,而插头插入消融则表明直接执行时手腕反馈的好处。