论文
MeSD:VideoLLM的多证据自蒸馏
MeSD: Multi-Evidence Self-Distillation for VideoLLM
摘要
虽然具有可验证奖励的强化学习为 VideoLLM提供了可靠的结果监督,但序列级奖励提供了有限的token级指导。 在策略自蒸馏通过在特权信息上调节自教师模型以提供密集的token级监督来解决此限制。然而,在单个教师模型上下文中聚合异质证据会掩盖交叉证据的一致性和冲突。进一步的挑战在于确定教师模型指南是否应该完善基于奖励的更新或为失败的轨迹提供纠正性监督。为了解决这些问题,我们提出了 MeSD,一种用于 VideoLLM的多证据自蒸馏框架。 MeSD 构建了三个具有共享参数的证据条件教师,使用真实答案作为共同的语义上下文,同时分别合并时间和空间证据。给定相同的学生模型生成的前缀,MeSD 评估相对于答案教师模型的证据特定偏好,并将教师模型常见偏好与门控教师模型特定残差融合。此外,MeSD 引入了验证引导优化,将轨迹分类为成功、失败或不确定。对于成功和不确定轨迹,MeSD 细化了token级别的优势幅度,同时保留了奖励衍生的迹象。对于包含所需证据的经过验证的故障轨迹,MeSD 应用故障条件蒸馏,对融合分布使用反向 KL 校正。对多个视频基准的实验表明,与强化学习和自蒸馏基准相比,具有一致的增益。
