论文
视觉-语言-动作模型的延迟反馈测试时扰动学习
Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
摘要
视觉-语言-动作模型(VLA)在顺序决策方面取得了显着的性能,但对于微妙的环境变化(例如物体姿势的微小变化)仍然很脆弱。我们将这种脆弱性归因于轨迹过度拟合,其中 VLA 过度关注动作和实体之间的虚假相关性,然后重现记忆的动作模式。我们提出了带有延迟反馈(PDF)的扰动学习,这是一种无需验证者的测试时间适应框架,可以在没有 微调 基础模型的情况下提高决策性能。 PDF 通过基于不确定性的数据增强和行动投票来减轻虚假相关性,而自适应调度程序则分配增强预算以平衡性能和效率。为了进一步提高稳定性,PDF学习了一个轻量级扰动模块,该模块可以在延迟反馈的指导下回顾性地调整logits的动作,纠正过度自信的问题。 LIBERO(+7.4\% 成功率)和 Atari(+10.3 人类归一化分数)上的实验表明,PDF 在任务成功方面比普通 VLA 和具有测试时间适应的 VLA 具有一致的增益,为多模式决策代理中可靠的测试时间适应建立了一条实用路径。代码可在 \href{https://github.com/zhoujiahuan1991/CVPR2026-PDF}{https://github.com/zhoujiahuan1991/CVPR2026-PDF} 获取。