论文
微调 离散扩散模型的连续时间强化学习框架
A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models
摘要
我们通过随机控制方法在具有离散状态空间和可能的任意动作空间的连续时间内制定强化学习(RL),其中状态动态被建模为受控连续时间马尔可夫链(CTMC)。我们考虑策略优化问题并推导相应的策略梯度方法,从而产生近端策略优化(PPO)和组相对策略优化(GRPO)的连续时间变体。作为主要应用,我们为基于 微调 分数的离散扩散模型开发了一个连续时间 RL 框架,该框架可以实现奖励驱动的优化,而不需要奖励信号的可微性。与仅依赖于终端奖励的现有基于 GRPO 的方法相比,我们的公式允许在整个去噪轨迹中纳入中间奖励或优势信号。重要的是,当专门用于掩蔽扩散模型(MDM)时,我们的框架包含了丰富的词汇单纯形策略参数化类别,具有易于分析处理的概率比,为 MDM 中的探索和策略优化提供了统一的视角。对于扩散 大语言模型 (dLLM),我们进一步提出轨迹二次采样技术来有效估计计算上禁止的轨迹可能性,从而降低计算每个位置概率比的计算成本。我们展示了我们的方法在低维熵正则化优化问题和 dLLM 的 RL 后训练 推理和编码任务上的有效性。