论文
ViCuR:视觉提示作为多式联运的可恢复权限 同策略 蒸馏
ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 通过在教师的监督下训练学生根据其自己的策略采样的轨迹来提高推理能力。在多模态推理中,常见的扩展是使用特权教师来观察仅训练时间的信号,例如参考答案或基本原理。然而,这种答案方特权造成了训练与测试的不匹配:教师的监督可能取决于学生无法获得的信号,鼓励捷径模仿而不是基于视觉的推理。我们提出 ViCuR,一个基于视觉的特权教师 蒸馏 框架,用视觉提示(输入中与查询相关的证据)取代答案方特权。因为这些线索源自推理时可用的相同视觉输入,所以学生可以恢复它们的证据。为了支持这一点,ViCuR 引入了一个轻量级线索恢复模块,该模块在预填充期间使用专用的接收器词元交叉注意将与任务相关的视觉证据聚合到内部表示中,而无需更改推理接口或需要辅助线索生成损失。在针对 Qwen3-VL-2B 和 8B 学生的七个基准测试中,ViCuR 的整体平均性能始终比基于答案的 同策略 自 蒸馏 提高了 +1.19 和 +1.24。它还自然地扩展到更强的教师 OPD,超过 OPD 基线 +0.64 和 +1.08,在 8B 规模上具有一致的域外增益。这些结果表明,在多模态同策略 蒸馏中,教师特权的设计与教师实力同样重要。