论文

预测性监管的走向决定了 VLA 政策的学习内容

Where Predictive Supervision Goes Shapes What VLA Policies Learn

模型评测模型行为与机制分析

摘要

未来预测越来越多地用于改进视觉语言动作(VLA)策略,其前提是预测场景演变鼓励对控制有用的表示。然而,仅预测质量并不能证明政策已经学会了更好的行动表示。这种区别在分布转移下很重要,其中成功的控制取决于保留空间状态和可能的场景变化超出熟悉的配置。我们研究了决定预测监督是否改善 VLA 策略使用的视觉表示的因素。通过与匹配的目标结构、预测范围和训练条件进行受控比较,我们发现不同的预测界面会产生明显不同的预测和视觉表示,包括超出熟悉场景的空间、动态和动作信息。我们将这些差异追溯到预测错误如何塑造政策的视觉流。与这一对照发现一致,经过更直接、场景匹配的未来监督训练的 VLA 策略在模拟和物理分配变化下表现出更强的鲁棒性。总之,我们的结果将未来预测构建为一个表征学习设计问题,其控制价值取决于其监督是否达到了政策发挥作用的表征。