论文
重新审视视觉-语言-动作模型中的参数冗余:VLM 到 VLA 适应的见解
Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation
摘要
视觉-语言-动作 (VLA) 模型通过集成预训练视觉-语言模型 (VLM) 的强大表示,在体现智能方面取得了重大进展。然而,VLA 的大量参数规模带来了沉重的计算负担,并且这些模型对参数剪枝表现出极大的敏感性。当前的范例通常将由此产生的性能下降视为不可避免的,依靠 微调 或低秩校正来恢复功效。我们质疑这一惯例,如果 VLA 修剪需要性能恢复才能有效,或者这种范式是否掩盖了对关键参数的不加区别的修剪,那么删除的参数是否真的是多余的。我们通过 VLM 到 VLA 适应的视角重新审视参数冗余,首先量化适应过程中参数发散的空间分布,以揭示不同模块之间的结构化模式。随后,我们引入受控修剪作为诊断探针:通过比较在没有任何 微调 的情况下删除不同参数子集对 VLA 性能的直接影响,我们在适应引起的发散信号和功能贡献之间建立了因果关系。基于发现的模块异构性,我们设计了一种多模块联合剪枝方案。对 LIBERO 基准的评估表明,我们的方法将 OpenVLA 和 $π_{0.5}$ 的参数减少了 12\%--30\%,同时保持了大约 90\% 的原始性能,而没有任何剪枝后恢复。相反,当在相同的无恢复约束下进行评估时,现有的参数修剪标准会导致总体性能崩溃。我们的研究揭示了 VLA 适应中的参数演化机制,并为在资源有限的环境中部署高效、稳健的机器人策略提供了一条新路径。