论文

VAD:多模态中目标重建的视觉证据 同策略 蒸馏

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

摘要

多模态 同策略 蒸馏 (OPD) 通过与特权视图教师监督学生生成的轨迹来传输细粒度的视觉知识。然而,它的下一个标记更正是源混合的,将视觉信号与语言先验和教师特定的效果相结合。关键的挑战是估计哪些校正得到视觉证据的支持,而不仅仅是在哪里或如何强烈地进行蒸馏。我们引入视觉归因 蒸馏 (VAD),这是一种反事实目标重建算法,用于估计教师校正的视觉归因部分。对于每个学生生成的前缀,VAD 都会评估同一固定教师,并提供和删除相关证据。中心对数概率的相应变化定义了 ut,它是视觉证据方向的签名代理,用于估计揭示证据如何支持或反驳候选标记。 VAD 将原始校正投影到该代理上,以获得干预对齐组件和代理无法解释的残差,然后根据前者重建学生锚定目标。在训练过程中,这个重建的目标提供主要的监督信号,而特权教师则提供弱正则化器。在 4B 和 9B 尺度的六个细粒度视觉基准中,VAD 的性能优于直接特权视图 蒸馏 和视觉优势加权。词元级别和受控目标分析表明,代理对齐组件在与任务相关的视觉校正中得到丰富,并产生更强的目标转移,特别是当证据反驳错误答案时。这些结果支持反事实目标重建作为源混合监督的有效替代方案。