论文

MeSD:VideoLLM的多证据自蒸馏

MeSD: Multi-Evidence Self-Distillation for VideoLLM

模型训练奖励建模与过程监督

摘要

虽然具有可验证奖励的强化学习为 VideoLLM提供了可靠的结果监督,但序列级奖励提供了有限的token级指导。 在策略自蒸馏通过在特权信息上调节自教师模型以提供密集的token级监督来解决此限制。然而,在单个教师模型上下文中聚合异质证据会掩盖交叉证据的一致性和冲突。进一步的挑战在于确定教师模型指南是否应该完善基于奖励的更新或为失败的轨迹提供纠正性监督。为了解决这些问题,我们提出了 MeSD,一种用于 VideoLLM的多证据自蒸馏框架。 MeSD 构建了三个具有共享参数的证据条件教师,使用真实答案作为共同的语义上下文,同时分别合并时间和空间证据。给定相同的学生模型生成的前缀,MeSD 评估相对于答案教师模型的证据特定偏好,并将教师模型常见偏好与门控教师模型特定残差融合。此外,MeSD 引入了验证引导优化,将轨迹分类为成功、失败或不确定。对于成功和不确定轨迹,MeSD 细化了token级别的优势幅度,同时保留了奖励衍生的迹象。对于包含所需证据的经过验证的故障轨迹,MeSD 应用故障条件蒸馏,对融合分布使用反向 KL 校正。对多个视频基准的实验表明,与强化学习和自蒸馏基准相比,具有一致的增益。

MeSD:VideoLLM的多证据自蒸馏的原论文方法或结果图
图 2:MeSD 概述。共享 EMA 参数的教师使用答案、时间和空间注释作为特权信息来评估学生模型生成的轨迹。使用答案教师模型作为锚点,教师模型分布融合通过门控共识残差分解聚合特定证据的偏好。轨迹验证决定了学生模型的学习方式。对于失败的轨迹,学生模型通过反向 KL 蒸馏来匹配融合的教师模型分布。对于其他轨迹,教师模型指导调整token级别更新的强度,奖励决定token是强化还是抑制。