论文

指导不是超参数:学习扩散语言模型中的动态控制

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

模型训练强化学习

摘要

无分类器指导(CFG)是一种广泛使用的用于控制基于扩散的生成模型的机制,但其指导尺度通常在整个生成过程中被视为固定的超参数。这种静态设计会产生次优的可控性和质量权衡,因为最佳指导程度因任务和扩散过程的不同阶段而异,尤其是在 NLP 领域。我们将 CFG 尺度选择重新定义为一个顺序决策问题,并提出通过强化学习来学习动态引导轨迹。具体来说,我们将指导尺度建模为基于不断演变的扩散状态在每个生成步骤中选择的离散控制动作,并在任务级奖励下使用近端策略优化(PPO)来优化策略。使用离散扩散语言模型对三个受控 NLP 生成任务进行的实验表明,与固定规模策略相比,自适应指导始终能够在可控性和生成质量之间实现更好的平衡。对学习策略的进一步分析揭示了跨任务的独特且可解释的指导轨迹,强调了将指导视为动态控制过程而不是静态设计选择的重要性。