论文

隐藏查看:VLM 蒸馏 中视觉锚定思维的推理前缀掩蔽

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

摘要

最近 VLM 中的思考-答案方法(例如 Qwen3-VL-Thinking)通过利用最终答案之前的中间思考步骤来提高推理性能,但它们的计算成本变得相当大,尤其是对于较大的 VLM。为了将这些功能提炼成紧凑的思考-答案 VLM,主要目标是提高学生在整个推理轨迹中利用视觉证据的能力,因为长的思考-答案轨迹会遇到视觉遗忘问题。为此,我们引入了一种新颖的思考答案 蒸馏 框架,该框架鼓励学生通过掩盖学生的显着推理前缀来将思维锚定在视觉信息上。为了弥补这种被掩盖的文字提示,我们鼓励学生在 蒸馏 期间更多地依赖视觉证据作为替代信息来源。我们的掩蔽策略包括:1)按标记显着推理前缀掩蔽,为每个下一个标记预测选择性地掩蔽高影响力推理前缀;2)自定进度掩蔽预算调度,根据 蒸馏 难度逐渐增加掩蔽规模,通过师生分布之间的差异来衡量。在 蒸馏 阶段,学生受到我们的显着推理前缀掩码的指导,该掩码会阻止未来标记和显着推理线索,而不是用于自回归语言建模的标准因果掩码。实验结果表明,我们的方法在多模态推理基准上优于最新的开源 VLM、VLM 蒸馏 和自我 蒸馏 方法,而进一步的分析证实了学生思维过程中视觉利用率的增强。