论文

扩散语言模型的掩模感知策略梯度

Mask-Aware Policy Gradients for Diffusion Language Models

模型训练强化学习

摘要

事实证明,强化学习对于改进 大语言模型 中的推理是有效的,但由于对数似然估计的棘手性,将其扩展到掩蔽扩散语言模型 (MDLM) 仍然具有挑战性。现有方法通过仅对标记预测进行建模来近似这种对数似然,忽略生成过程中位置被揭露的顺序。我们观察到 MDLM 的生成在每个步骤都涉及两个决策:在每个屏蔽位置放置什么词元以及重新屏蔽哪些位置。我们将其形式化为两阶段操作 MDP,表明策略梯度自然分解为标记项和掩蔽项。结合这两个术语的优化,可以在数学推理和编码基准上获得最先进的结果,在 GSM8K 上得分为 87.1%,在 MBPP 上得分为 53.4%。