论文

你所说的话中的原因:白话释义 离策略 VideoLLM 中推理 蒸馏 的痕迹

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

摘要

最近的 大语言模型 在复杂推理任务上取得了出色的性能,其中使用组相对策略优化(GRPO)的强化学习已成为在自生成轨迹上优化模型的领先范例。然而,GRPO 的 同策略 性质将模型限制在它已经可以产生的推理技能上,限制了学习更高级的能力。先前的工作从更强大的教师政策中注入了特权推理痕迹来指导训练,但这些痕迹本质上与学生政策无关。我们观察到,同策略 和 离策略 之间的这种不匹配会导致语义关键推理标记上的梯度剪切,最终奖励正确的答案,同时留下证明它们合理的推理。因此,我们提出了 \textbf{Echo-GRPO},一个让模型用它所说的话进行推理的框架。 Echo-GRPO 没有模仿教师模型中的低概率特权痕迹,而是将它们重写为学生策略自己的 \textit{idiolect},即其自己的特征词汇和表达模式,同时通过双参考解码保留其语义。我们将该框架实例化为用于视频推理 蒸馏 的 \textbf{VideoEcho-R1},在三个多模式 LLM 主干和五个基准上实现了一致的改进。最后,我们表明,我们的白话释义是一个插件模块,可以持续改进 RL 和用于推理 蒸馏 的监督 微调 框架,证明政策一致的监督超出了 GRPO 的范围。