论文
先放下后恢复:视觉-语言-行动模型有多冗余?
Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
摘要
视觉-语言-动作 (VLA) 模型支持指令驱动的机器人操作,但它们从预训练的 VLM 继承了超大的语言骨干,其容量远远超过了短机器人指令所需的容量。这就提出了一个基本问题:闭环控制实际上需要多少 VLA 模型?在这项工作中,我们通过使用 Transformer 块去除作为受控干预来研究 VLA 模型中的架构冗余。我们引入了 \textbf{Drop-Then-Recovery (DTR)},一种分析协议,它从预训练的 VLA 模型中删除选定的块,然后微调结果模型以测量删除的容量是否是下游控制所必需的。为了使这种干预可靠,我们提出了 \textbf{GateProbe},这是一种一次性虚拟门敏感性指标,根据块对下游动作损失的贡献对块进行排名。在多个 VLA 架构、操作基准甚至真实的机器人工业场景中,我们发现移除后的可恢复性存在很强的不对称性:\ul{\textit{语言主干对于标准机器人操作任务来说是高度冗余的,而视觉和动作路径对于移除的容忍度要低得多}}。在 LIBERO 上,在相同的下游 微调 预算下,删除一半的 LLM 块甚至可以将 OpenVLA-OFT 从 95.0% 提高到 98.3%,并且仅保留两个语言块仍然可以恢复基线水平的性能。这些结果表明,当前的 VLA 基准可能对深层语言与动作的对应和组合指令理解施加有限的压力,并且未来的 VLA 架构应该更谨慎地跨语言、视觉和动作组件分配容量。代码可在 https://github.com/s1ghhh/VLADrop 获取。