论文

Opt2VLA:力感知视觉-语言-动作,用于接触丰富的人形全身操纵

Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation

智能体系统Agent 环境交互

摘要

人形机器人有望在日常环境中执行各种人类级别的任务,其中许多任务需要精确调节交互力。虽然最近的视觉-语言-动作(VLA)模型在语义规划和视觉运动控制方面表现出了希望,但现有的人形系统主要通过几何运动目标来表示动作,并依赖于专注于运动跟踪的全身控制器,对交互力的显式推理或控制有限。这种限制在接触丰富的任务中尤其重要,其中几何相似的运动可能需要不同的力机制,具体取决于任务上下文,并且视觉观察在接触后可能变得不可靠。在这项工作中,我们提出了 Opt2VLA,这是一种力感知的 VLA 框架,它在 VLA 到控制接口上引入了显式的力命令,用于人形全身操作。单个多任务 VLA 策略联合预测几何运动目标和连续接触力参考,这些目标由基于任务特定的强化学习 (RL) 的全身控制器进行跟踪。为了提供可扩展且基于物理的监督,我们通过具有明确力参考的全身轨迹优化(TO)生成动态可行且接触一致的训练数据。我们在三个接触丰富的人形任务上评估了 Opt2VLA,结果表明,与仅运动控制相比,显式力调节能够实现更准确和一致的力调节,而 TO 的符合物理机制的力矩监督进一步提高了力跟踪的准确性和稳定性。闭环评估进一步证明了在模拟和人形硬件上使用 Opt2VLA 进行语言条件力调制。