论文

从去噪反馈中强化学习

Reinforcement Learning from Denoising Feedback

模型训练强化学习

摘要

策略损失估计仍然是扩散语言模型 (DLM) 强化学习 (RL) 中的一个基本且长期存在的挑战。我们引入了去噪反馈强化学习(RLDF),这是一种新颖的训练范例,它利用从轨迹采样和训练过程中获得的反馈来促进准确有效的策略损失估计。为了平衡计算效率和估计有效性之间的权衡,RLDF 将模型从中间噪声状态优化为剪切干净状态,并结合去噪时间步长上的加权时间步长采样。大量实验表明,RLDF 在两种代表性 DLM 架构(LLaDA 和 Dream)上在多个推理基准上实现了性能和通用性方面的一致且实质性的改进。我们的工作为扩散语言模型中的可扩展强化学习奠定了原则基础。我们构建了 Drift,这是一个 DLM 训练框架,可在 https://github.com/ant-research/Drift 上获取。