论文
冻结的 VLA 对成功已经了解了什么:基础机器人政策中类似价值结构的探索性研究
What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies
摘要
视觉-语言-行动(VLA)政策经过训练来模仿行动;他们的损失从不要求他们估计回报、进步或未来的成功。然而,它们的冻结表示携带了此类信息,并且可以将其读出并用于指导行动选择,而无需重新训练政策。从 LIBERO-Goal 上成功和失败的混合操纵轨迹中,我们使用冻结特征上的轻量级线性探针恢复蒙特卡罗结果目标。根据 OpenVLA、Pi0.5、DINOv2 和 CLIP 功能,目标始终是可预测的,而根据基于进度、剩余时间、任务身份或本体感觉构建的基线,目标的预测性要低得多。为了排除任务和时间捷径,我们在相同任务、相同时间步长匹配比较下评估探针:Pi0.5 探针仍然达到大约 92% 的成对排序精度,而标签改组的对照仍然存在偶然性。用作采样 Pi0.5 动作前缀的测试时间选择器,同一个探针将这种离线发现转化为行为:在推板上,成功率从贪婪解码下的 26.7% 上升到 44.3%,在酒架上出现了第二个阳性案例。这些收益并不通用,需要额外的推理计算,但潜在的发现很明确:冻结的 VLA 已经编码了有关成功的信息,而其模仿目标从未明确要求这些信息。