论文

相信你的直觉:视觉-语言-动作模型的置信驱动测试时强化学习

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

模型训练强化学习

摘要

强化学习 (RL) 已成为推动视觉-语言-动作模型 (VLA) 超越静态模仿学习的不可或缺的因素。然而,现有的强化学习方法通​​常需要外部环境反馈,依靠预定义的成功信号来指导策略更新。在这项工作中,我们表明 VLA 模型具有有用的内部评估能力:在离散动作 VLA 中,具有较高生成置信度的轨迹显着更有可能成功。基于这一观察,我们引入了 T^2VLA(测试时 VLA),这是一种与架构无关的测试时 RL 框架,使 VLA 模型能够实现自引导策略改进。 T^2VLA 不依赖外部奖励,而是利用轨迹级别与高置信度专家演示的相似性作为内在奖励信号。此外,我们提出了一种置信驱动的双专家引导机制,该机制动态平衡用于探索的本地伪专家和用于训练稳定性的全局专家库。对 LIBERO 和 RoboTwin 基准的大量实验表明,T^2VLA 始终优于监督基线,并通过 真值 奖励接近预言机 RL 性能,无需外部奖励反馈即可实现有效改进。此外,T^2VLA 适应不同的 VLA 范例,包括 OpenVLA-OFT 和 pi 系列。