论文
VANE:通过未来视觉表示预测对视觉-语言-动作模型进行可靠的测试时训练
VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction
摘要
测试时训练(TTT)提供了一种轻量级的方法来适应来自未标记部署流的视觉-语言-动作(VLA)策略,但它仍然难以在闭环操作中可靠地使用。共享的适应空间可以混合不兼容的任务修正,而在线更新可以在其后果已知之前改变后续操作。我们为 VLA 策略引入了可靠的 TTT 框架 (VANE)。 VANE 条件促进对当前视觉(语言环境)的适应,并从执行动作的未来视觉后果中学习。候选更新与实时策略隔离,根据后续观察进行评估,并且仅在得到未来证据支持时才进行提交,从而使适应具有选择性和可逆性。在 SimplerEnv WidowX 上,VANE 比相应的 TTT 基线平均成功率提高了 3.2 个百分点。 Google Robot 的结果进一步表明,部署时间增益仍然依赖于任务和实施例。总之,这些结果展示了一种在互动过程中调整 VLA 政策的有约束的、基于证据的方法。