论文

RL$^2$-VLA:自适应 RL 潜在组合转向,具有视觉语言动作模型的测试时间缩放

RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

模型推理测试时计算扩展

摘要

尽管视觉-语言-动作(VLA)模型具有令人印象深刻的视觉运动能力,但它们的性能在执行具有挑战性和域外任务时通常会下降。最近的测试时引导和扩展方法无需大量数据收集和再训练即可提高性能,但动作样本通常仍然集中在类似的行为上,因此继承了相关的故障模式。此外,现有方法在每个时间步都应用相同的干预策略,无论基本政策是否已经有可能成功。为了解决这些限制,我们引入了 $RL^2$,这是一种自适应推理时间引导框架,利用 VLA Latent 上的强化学习。首先,我们训练一个轻量级离线强化学习策略,该策略以从 VLA 动作专家中提取的表达潜伏为条件,并在推理过程中将其流速与冻结的 VLA 的流速组合起来。这种组合引导策略将大规模模仿学习的行为先验与超越主导演示模式的离线强化学习引起的动作多样性结合起来。我们进一步发现,推理时间控制在成功和失败状态下遵循根本不同的缩放法则,这表明当基本 VLA 可能失败时,动作多样性是最有益的,但当可能成功时,可能会不必要地干扰已经准确的动作。基于这一见解,$RL^2$ 仅在预测到故障时才激活组合转向。在 SIMPLER 和 PolaRiS 基准测试中,$RL^2$ 在域外设置中将成功率提高了高达 +17.3%,而消融和缩放研究证明了潜在表示和 RL 训练的重要性。最后,现实世界的实验证明这些收益超越了模拟,将 $RL^2$ 建立为 VLA 部署的实用模块化指导框架。