论文
纠正看不见的部分:多模态推理模型中感知蒸馏的信用分配
Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners
摘要
在线策略蒸馏为多模态推理模型提供密集监督,但其轨迹级奖励无法判断一个错误答案究竟源于感知还是后续推理。通过共享同一感知的多次推理估计出的感知成功率(PSR)仍然含混,因为低成功率把感知不足与推理困难混为一谈。我们提出感知纠正蒸馏(Perception-Correction Distillation,PCD),一种无标签方法,以下游失败与师生分歧作为互补见证来识别可纠正的感知失败。两个见证的乘积构成一个软与门,只有当两者同时出现时才加强蒸馏。我们用贝叶斯证据组合论证该规则,并证明乘法是唯一在任一见证缺失时归零的归一化双线性门。PCD 采用分离的感知—推理 rollout 与保持均值的加权,不改变推理目标。在八个基准上,PCD 将 8B→2B 的宏平均从 OPD 的 44.50 提升到 47.28,将 32B→8B 的结果从 56.94 提升到 61.22。在匹配的 2B 消融中,移除 PCD 与分离 rollout 分别使留出平均下降 2.22 和 0.88 分。因此,有效的多模态蒸馏不仅取决于教师预测了什么,还取决于识别何时感知才是应当被纠正的对象。
