论文

教方法不教答案:面向多模态推理的特权导师蒸馏

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

模型训练强化学习

摘要

最近的训练后方法,特别是具有可验证奖励的强化学习(RLVR),显着增强了大视觉语言模型(LVLM)的推理能力。然而,可验证奖励的稀疏性为失败的执行轨迹提供了很少的词元级监督,通常导致复杂的多模态推理任务中的探索效率低下。尽管策略蒸馏可以提供密集的指导,但基于外部教师的方法会引入大量的计算开销,而答案条件调整方法可能会暴露答案级别的信息并引发类似快捷方式的生成行为。为了解决这些限制,我们提出了 PTD-PO,这是一种针对 RLVR 的特权辅导蒸馏策略优化框架,它提供密集的指导,而不会暴露学生策略的答案。具体来说,PTD-PO 从空间注意引导和中间文本推理步骤构建结构化特权提示,并通过上下文学习使用它们来产生逐步的词元分布监督。学生仍然在原始无答案上下文下进行优化,并且其失败的执行轨迹与词元分配级别的提示增强参考模型保持一致。为了在引导和非引导上下文之间的分布变化下进一步稳定蒸馏,我们引入了 Top-K Jensen-Shannon 散度目标,该目标将重点放在信息标记概率上,同时减少内存开销。对 2B 到 8B 参数范围的 LVLM 进行的实验表明,PTD-PO 始终优于 RLVR 和蒸馏基线,减轻熵崩溃,并提高复杂的多模态推理性能。

教方法不教答案:面向多模态推理的特权导师蒸馏:论文配图
图 1:PTD-PO 的概念图。 (a) PTD-PO 通过无答案特权提示来补充稀疏奖励 RLVR,避免了答案揭示蒸馏的过度确定性行为。 (b) 在一个失败的几何示例中,参与者从纯问题上下文中给出了错误的答案。特权提示引导参考模型关注面积关系和等面积框架,并在不暴露最终面积的情况下推断 A​B​C​DABCD、E​F​G​HEFGH 和 I​J​K​LIJKL 之间的关系。由此产生的提示增强教师分布为纠正失败的学生轨迹提供了密集的监督。