论文
以行为事件关联视觉语言动作策略的稀疏自编码器分析
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
摘要
视觉-语言-动作(VLA)策略将语言和视觉输入转换为机器人动作,其中它们的隐藏表示直接塑造闭环行为。然而,来自语言和视觉语言模型的机制可解释性工具并不能直接迁移到 VLA:输出是机器人动作而不是人类可读的标记,并且干预措施只能通过昂贵的闭环交互轨迹进行测试。我们提出了一种基于事件的可解释性管道,将 SAE 特征分析锚定到行为事件而不是文本上下文。末端执行器关键帧使用视觉、状态和时间线索聚集在每个任务中,将 SAE 特征与行为显着事件联系起来,并通过可选的 VLM 注释与语义上下文联系起来。据我们所知,我们的管道是第一个在闭环行为事件中进行基于 SAE 的 VLA 分析的管道之一。在两个模拟架构和真实机器人研究中,基于事件的排名对 OpenVLA 产生最强的因果效应,并迁移到 $π_{0.5}$ 的连续动作块。 SAE 是一个稀疏但不完善的干预基础:可用性随架构和干预部位的不同而变化,强干预揭示了安全性和可解释性的限制。总体而言,基于事件的 SAE 分析成为行为锚定的 VLA 可解释性的实用起点,激发了未来对 SAE 功能的研究,超越了行动协调坐标、更细粒度的闭环评估和高风险 VLA 部署的安全干预。代码可在 \url{https://github.com/xc-j/Event-SAE} 获取。