论文

从恢复到下降:后训练 操作如何降低 VLM 的后层深度解码能力

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

模型评测模型行为与机制分析

摘要

在构建视觉语言动作模型 (VLA) 的 后训练 过程之后,视觉语言模型 (VLM) 的空间理解还剩下多少?我们从权重匹配的开源基础 VLM/VLA 对(Molmo2-ER 和 MolmoAct2-LIBERO)的每个解码器层探索深度感知,这是空间几何理解的基本要素。首先,VLA 在每一层的解码深度都较差,我们称之为下限的持续间隙。其次,退化并不均匀:虽然基础 VLM 的深度解码能力通过其最后几层得到改善,但 VLA 的崩溃,即我们称之为悬崖的额外后期层下降。我们将悬崖因果地定位到后期层 MLP 干扰:消除后期层 MLP 写入可恢复大部分终端可解码性悬崖,而匹配的注意力消除和权重匹配的基础 VLM 中的相同干预则不会产生可比较的恢复。模块级分解解释了这种分离:基础 VLM 在累积的 MLP 写入中最容易访问深度,而操作 后训练 在后期累积的写入中破坏深度可解码性。