论文

先见后推理:捷径弹性多模态的感知与推理解耦 同策略 Self-蒸馏

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

摘要

同策略 self-蒸馏 (OPSD) 在其自己的采样轨迹中训练模型,并使用冻结副本提供以参考目标为条件的密集 词元级 目标。这对于 LLM 推理来说效果很好,但是对多模式 大语言模型 (MLLM) 的直接扩展可以创建一个快捷方式:特权目标可以主要基于文本引用目标而不是图像来引导标记。我们提出了 ViGOS,这是一个针对 MLLM 后训练 的基于视觉的 OPSD 框架。学生首先写出视觉描述,然后推理出最终答案。对于有效的采样轨迹,仅图像感知教师监督描述,而特权推理教师监督同一学生前缀的推理和最终答案。参考教师仅用于无效的采样轨迹以恢复输出格式。在一般视觉语言、专家推理、视觉数学、空间定位和视觉语言先验基准测试中,ViGOS 保留了 OPSD 的主要优点,并改进了在容易走捷径的环境中基于图像的行为。