论文
VLA 的层之谜:VLA 潜在接口的信息理论分析
The Layer Mystery of VLA: An Information-Theoretical Analysis of VLA Latent Interface
摘要
视觉语言动作(VLA)策略通过潜在接口将预训练的视觉语言主干连接到动作头,但该接口应暴露哪些主干层仍不清楚。我们研究了三个预训练模型和两个操作基准(LIBERO 和 CALVIN)的冻结主干的单层选择和多层融合,每个配置有三个策略训练种子。在三种融合机制和三层子集策略中,54 种配置中有 47 种配置的性能低于观察到的最佳单层策略。我们的统计分析进一步证实融合的优势非常有限。然而,最佳层在主干网和基准之间存在很大差异,使得层选择必然而详尽的策略扫描成本高昂。我们进一步推导了针对动作条件 InfoNCE 和动作预测所提出的信息瓶颈目标之间的重新加权等价性,从而激励 InfoNCE 作为层质量的代理。根据经验,InfoNCE 在四个评估指标中提供了与政策成功最一致的正相关关系。选择 InfoNCE 分数最高的层所需的 GPU 计算量比详尽的策略扫描少 9-33 倍,并且在六种设置中将平均选择遗憾从最深层选择的 17.89 个百分点减少到 3.71 个百分点。其平均后悔值接近使用所有六次预言机扫描进行回顾性优化的固定层启发式算法所获得的 3.28-3.50 分,无需在选择过程中进行闭环评估。