论文

学习对 VLA 说些什么:基本无害的视觉语言动作模型指导

Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering

智能体系统Agent 环境交互

摘要

视觉-语言-动作(VLA)模型为机器人控制提供了自然语言接口,但从语言到行为的映射通常是脆弱且不直观的:语义相似的指令可能会引发截然不同的行为,而某些功能可能无法仅通过提示来获得。因此,人类指令和零样本语言模型都无法可靠地引导 VLA 成功执行任务。在这项工作中,我们提出了一个框架,以交互方式搜索可提高闭环 VLA 任务性能的语言序列,将这些序列提炼为测试时语言反馈策略(LFP),并学习一个改进头来预测语言控制何时会提高性能。我们对这个改进头进行保形,以防止有害的指导干预,在这种情况下,相对于分布外场景的原始指令,LFP 会降低任务性能。至关重要的是,我们的方法在任意冻结的预训练 VLA 上运行,既不需要访问原始训练分布,也不需要访问底层模型的 微调。在所见环境中,我们的保形 LFP 在模拟中将基础 VLA 性能提高了 24.7%,在硬件中提高了 65.0%。在视觉和语义扰动方面,我们的保形 LFP 具有强大的无害保证,并产生开环提示下未观察到的恢复行为。