论文

KEPO:用于推理强化学习的知识增强偏好优化

KEPO: Knowledge-Enhanced Preference Optimization for Reinforcement Learning with Reasoning

模型训练强化学习

摘要

强化学习(RL)已成为在大语言与视觉-语言模型中诱导显式推理行为的有前景范式。然而,面向推理的RL后训练在根本上仍具挑战,原因是稀疏的轨迹级奖励导致模糊的贡献归因与严重的探索失败,可能把策略困在学习悬崖上。近期的在线策略蒸馏方法引入密集的教师监督以稳定优化,但对所有生成的轨迹一视同仁。我们认为,这种均匀蒸馏不适合推理密集型任务,因为低质量的在线策略轨迹常源于早期逻辑错误,而在有缺陷的上下文下蒸馏会注入噪声大且错位的梯度。为应对这些挑战,我们提出知识增强偏好优化(KEPO),一个统一的后训练框架,它整合:(i)质量门控的在线策略蒸馏目标,只对高质量轨迹选择性施加密集教师引导;(ii)知识增强探索策略,利用从教师模型学到的提示以拒绝式采样奖励为正的在线策略轨迹用于RL,从而缓解探索坍缩。在一个具有挑战性的医疗视觉问答基准上以单源泛化设定评估,KEPO展示出更高的训练稳定性、更连贯的推理行为,以及优于强化学习与在线策略蒸馏基线的域外性能。

KEPO:面向多模态推理的知识增强偏好优化及其在医疗VQA中的应用
(b) 跨分布外(out-of-distribution)模态的平均准确率(对 7 种模态取平均)。