论文

弹性查询强化学习:VLA 模型的自我意识策略执行

Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models

模型推理测试时计算扩展

摘要

视觉语言动作(VLA)模型是用于机器人操作的强大动作生成器,但它们通常以固定的推理和重新规划时间表执行。这种刚性忽略了机器人控制的不均匀难度:接触丰富或不确定的状态可能需要更多的计算和更新的反馈,而更简单的状态通常可以用更少的推理步骤和更长的开环执行来处理。我们提出了弹性查询强化学习(EQRL),这是一个使每个 VLA 策略查询具有弹性的框架。轻量级潜在调度适配器联合选择潜在输入、去噪预算和动作块长度,无需 微调 底层 VLA 模型。为了使调度困难意识,EQRL 训练联合潜在调度动作的批评者,并从批评者整体分歧中得出状态难度信号。该信号引导计算走向困难状态,而学习的残差允许任务驱动的校正。我们将可变块执行制定为具有依赖于块的折扣和摊销函数评估数量(NFE)预算的查询级宏动作强化学习。在模拟和真实机器人操作中,EQRL 降低了摊余推理成本,同时保持或提高了任务成功率。