利用 VLA:通过内存引导代理将冻结的 VLA 引导为可靠的操作原语
Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
摘要
语言条件操纵需要精确的、丰富的接触控制和对语言、场景和长远视野的强大推理。端到端视觉-语言-动作(VLA)模型提供了强大的局部视觉运动技能,但它们是在分布任务轨迹上进行训练的,并且经常在部署扰动(例如语义重定向、目标重新绑定、空间布局变化和不稳定的局部接触)下失败。 LLM 编码智能体 提供互补的语义和组合推理,但纯粹的分析基元在不规则抓取、约束放置和铰接对象交互方面遇到困难。我们提出了 Harness VLA,这是一个内存增强的代理框架,它将冻结的 VLA 公开为可重试的接触丰富的原语,并将其与一个用于目标定位、分段、传输、导航和释放的小型固定分析原语库组合在一起。Harness不是扩展技能库,而是从特定于任务的执行跟踪、全局成功规则和失败模型中学习这些固定原语的操作范围。通过将语义重新定位语义目标、非接触执行和 VLA 重新分级提升给规划器,同时为局部接触丰富的阶段保留冻结的 VLA,Harness VLA 将预训练的 VLA 扩展到其原始轨迹分布之外,而无需进行微调。在受干扰的桌面、家庭厨房和清洁到随机双手操作方面,Harness VLA 在 LIBERO-Pro 和 RoboCasa365 上分别比最强相关基线提高了 38.6 和 25.4 个百分点,在 RoboTwin C2R 上达到 58.4%。双 Franka 机器人的真实演示进一步展示了目标重定向、抓取恢复以及具有相同冻结 VLA 的新任务组合。代码可在 https://github.com/RLinf/RPent 获取。