论文

从 VLA 表示中解码任务进度

Decoding Task Progress from VLA Representations

模型评测模型行为与机制分析

摘要

视觉-语言-动作模型(VLA)正在迅速朝部署为通用操纵策略的方向发展,但我们目前缺乏基本工具来理解这些模型在内部代表什么或在运行时监控它们。利用机械可解释性的思想,我们探测 $π_{0.5}$ 的残余流,并发现任务进度(轨迹中剩余的归一化时间)可以从激活中线性读取。我们发现,在对任何机器人特定数据进行训练之前,该信号就存在于预训练的 PaliGemma 主干中。当在多提示数据上进行训练时,单个线性探针可以泛化到看不见的任务,并且在语言反事实下发生变化,但无法实现有意义的策略指导。这些属性使信号可直接用于检测部署的 VLA。我们使用探针作为简单的无标记 OOD 检测器,它可以检测停滞的任务进度,并发现它与最先进的方法具有竞争力。我们的结果表明,VLA 具有丰富的、线性可读的语义量(例如任务进度)的内部表示,并且学习读取这些信号为监控部署的视觉运动策略提供了一条轻量级、可解释的路径。