论文
OPD-Aha:从语言动力到多模态同策略蒸馏中的视觉反思
OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy Distillation
摘要
特权的策略蒸馏允许教师使用丰富的、仅限训练的视觉证据来评估学生的轨迹,从而改善多模式推理。两个模型都会对这些轨迹进行评分,同时以相同的学生生成的前缀为条件。当学生在回答的早期误解了图像时,这种不断累积的错误理由最终会让老师远离其视觉证据。教师和学生聚集在同一个幻觉上,导致标准的跨模型监督在最需要纠正的地方崩溃。我们发现,在这种误导性的协议下,教师的视觉矫正偏好并没有消失。比较同一位老师在给定真实图像和视觉零值的情况下的预测表明,特权证据仍然推动模型走向正确的解释。我们引入了 OPD-Aha,它直接从这种孤立的视觉偏好中重建蒸馏目标,而不是依赖于脆弱的师生差异。这个重建的目标积极地抑制与图像相矛盾的连续部分。以此为目标进行训练后,学生们学会用“等待”和“实际”等反思标记自然地打断自己有缺陷的推理。经过反思,后人不再依赖积累的错误文本,而更多地依赖视觉证据。在中期纠正这些轨迹从根本上改变了推理过程,在不同的细粒度感知和复杂的多模态推理基准上产生广泛且一致的改进。我们的代码和模型可在 https://github.com/Echochef/OPD-Aha 获取。