论文

视觉-语言-动作模型中的闭环神经激活控制

Closed-Loop Neural Activation Control in Vision-Language-Action Models

智能体系统Agent 环境交互

摘要

视觉-语言-动作(VLA)模型可以通过干预具有语义意义的内部方向在测试时被引导,但现有方法使用固定的引导系数,实际上是开环运行。这与具身控制很不匹配:任务状态与概念误差随时间演化,常导致过度校正、振荡和任务成功率下降,对速度与平滑性等时间性行为尤其如此。我们提出CTRL-STEER,一个用自适应、时变的控制信号取代静态干预强度的闭环框架。关键思想是将表征与调控解耦:不假设时间性概念由单个神经元直接控制,而是沿运动对齐的残差方向进行引导,同时由反馈控制器在线调整干预幅度。我们分别用PID和基于强化学习的控制器实例化该框架。在微调后的OpenVLA策略上、跨四个LIBERO任务套件的实验表明,CTRL-STEER在无需修改或重训基础模型的情况下,相比固定系数基线实现了更稳定的概念调控和更好的引导-任务成功权衡。

视觉-语言-动作模型中的闭环神经激活控制:论文配图
图 1:我们展示了转向高度对“拿起书并将其放入书架后部隔间”任务的影响。无转向模型使末端执行器保持较低。静态转向增加了高度,但未能获得较高的任务成功率。闭环转向可在完成任务的同时保持较高的末端执行器轨迹。