论文

离散倾斜匹配

Discrete Tilt Matching

模型训练强化学习

摘要

掩蔽扩散 大语言模型 (dLLM) 是自回归生成的一种有前途的替代方案。虽然强化学习 (RL) 方法最近已适应 dLLM 微调,但它们的目标通常取决于序列级边际似然,这对于掩模扩散模型来说是棘手的。为了解决这个问题,我们推导了离散倾斜匹配(DTM),这是一种无似然方法,它将 dLLM 微调 重塑为奖励倾斜下局部揭露后验的状态级匹配。 DTM 采用具有显式最小化器的加权交叉熵目标的形式,并允许提高训练稳定性的控制变量。在综合迷宫规划任务中,我们分析了 DTM 的退火计划和控制变量如何影响训练稳定性并防止模式崩溃。就规模而言,带有 DTM 的 微调 LLaDA-8B-Instruct 在数独和倒计时方面产生了强劲的收益,同时在 MATH500 和 GSM8K 上保持竞争力。