论文

能编码却未有效利用:冻结VLA如何使用视觉历史

Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History

模型评测模型行为与机制分析

摘要

冻结VLA每个决策步骤都接收近期观测,但已有研究多关注增加记忆,较少核对现有历史如何表示和使用。论文在两类架构的三个VLA上进行逐层线性探测与因果互换干预,发现三方面分离:过去画面在网络各层仍可线性解码;历史中区别于当前帧的独有信息几乎缺失,表明已存历史大部分是当前信息的冗余副本;只有当前帧严重受损时,历史才产生明显因果作用,动作输出对历史的依赖又沿网络逐渐下降。虽然模型的历史编码相似,使用方式却不同:相同遮挡下,一类架构更依赖历史作为后备,另一类依赖更少。无需训练的时间信息使用检查可区分两种情形。在后备机制中,重新注入历史既未修复遮挡,也未消除动作歧义;在另一机制中,相同干预则能稳定将动作引向提供历史的样本。结果显示,动作可被历史引导取决于历史使用机制,而不只是能否编码。未来记忆增强应注入过去独有的信息,而不只是增加历史数量。