论文
VLA-Trace:通过表示与行为追踪诊断视觉-语言-动作模型
VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing
摘要
理解视觉-语言-动作(VLA)模型如何将多模态知识转化为具身控制仍是一个开放挑战。我们提出VLA-Trace,一个渐进式诊断框架,通过从表示动态到因果控制归因再到行为表现的统一证据链来分析VLA模型。它具体结合了跨模态与检查点漂移的中心核对齐(CKA)来追踪表示演化、注意力敲除干预来识别模态特异的控制通路,以及rollout级行为探针来检验接地、捷径依赖与语义跟随。在 $\pi_{0.5}$ 与OpenVLA上的实验揭示了三个关键发现。其一,两个模型在VLA微调过程中表现出截然不同的模态特异适配动态。其二,二者在动作解码时依赖不同的多模态路由策略与逐层依赖关系。其三,尽管VLA策略擅长视觉接地的轨迹生成,它们在细粒度语义跟随上仍然受限。这些发现为表示保持式适配、因果VLA回路与组合语义控制指明了未来方向。
