论文
视觉前视视觉-语言-动作模型的测试时训练
Test-Time Training for Visual Foresight Vision-Language-Action Models
摘要
Visual Foresight VLA (VF-VLA) 因其令人印象深刻的性能而成为最近 VLA 中的一个突出的架构选择。然而,VF-VLA 的固有设计使其特别容易受到分布外 (OOD) 变化的影响。由于动作的质量直接取决于预测的未来视觉信息的准确性,因此 OOD 条件会同时影响两个阶段。为了解决这个漏洞,我们提出了测试时训练视觉预见 VLA ($T^3$VF),这是一种测试时训练方法,其动机是观察预测的未来图像及其后续观察形成自然监督对。为了进一步解决不加区别的测试时更新带来的实际挑战,我们引入了自适应更新过滤机制。根据经验,$T^3$VF 以适度的额外推理成本缓解了 VF-VLA 的 OOD 漏洞,而不需要任何架构修改或辅助模块。