论文
更好的教师监督就足够了吗?解锁多模态在on-policy蒸馏中的学生端学习
Is Better Teacher Supervision Enough? Unlocking Student-side Learning in Multimodal On-Policy Distillation
摘要
在策略蒸馏(OPD)通过教师对学生自己的轨迹提供词元级监督来改进推理。现有的方法主要侧重于加强教师方面的指导(例如,通过丰富教师的输入和完善教师的反馈),但我们发现有限的学生感知是多模态 OPD 的另一个关键瓶颈。通过提供预言机视觉事实,无论是弱教师还是强教师,经过 OPD 培训的学生的表现仍然可以得到大幅提高。为了解决这个瓶颈,我们提出了 S-OPD,这是一种简单的多模态同策略蒸馏框架,它通过两个目标明确加强学生的感知学习。具体来说,教师校准的策略对比通过基于教师的标记级门控将原始图像和蒙版图像下的学生策略分开,从而加强了学生在推理过程中对视觉证据的依赖。政策协议根据原始图像和受噪声干扰的图像调整学生政策,进一步提高对视觉噪声的感知鲁棒性。值得注意的是,我们的方法可以无缝插入现有的 OPD 框架,不需要额外的数据注释、模型参数或推理操作。对跨学生规模和蒸馏范式的八个基准进行的广泛实验表明,性能得到了一致的改进,在 LogicVista 上提升了高达 4.25 分。当与现有的教师端监督方法相结合时,我们的方法可以产生进一步的收益。代码可在 https://github.com/Sirilaw/S-OPD. 获取