论文
通过变分策略从语言反馈中学习 蒸馏
Learning from Language Feedback via Variational Policy Distillation
摘要
可验证奖励的强化学习(RLVR)受到结果信号稀疏的影响,在复杂的推理任务上造成严重的探索瓶颈。最近的 同策略 自 蒸馏 方法尝试通过利用语言反馈来生成密集的 词元级 监督来解决这个问题。然而,这些方法依赖于固定的、被动的教师来解释反馈。随着学生政策的改善,教师的零样本评估能力趋于稳定,最终停止了进一步的学习。为了克服这个问题,我们提出了变分策略 蒸馏 (VPD),一个将语言反馈学习形式化为变分期望最大化 (EM) 问题的框架。 VPD 共同演化这两种策略:在 E 步中,教师通过自适应信任区域更新积极完善轨迹结果,将文本反馈转化为动态改进的目标词元分布。在 M 步骤中,学生将这种密集的分布式指导内化到其自己的 同策略 卷展中。通过不断提高教师从文本批评中提取可操作信号的能力,VPD 克服了被动 蒸馏 的局限性。通过对科学推理和代码生成任务的不同诊断反馈来源进行评估,VPD 始终优于标准 RLVR 和现有的自我 蒸馏 基线。最后,通过在严格的数学推理和冷启动机制上对我们的框架进行压力测试,我们阐明了反馈驱动的自我 蒸馏 与纯环境驱动的 RL 相比的基本界限。