论文

A2D2:用于自适应解码的 微调 任意长度离散扩散

A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding

模型训练强化学习

摘要

离散扩散模型为序列生成提供了一个简单且稳定的基于可能性的框架,最近通过词元插入扩展到任意长度设置。然而,用于任意长度离散扩散的有原则的奖励引导 微调 仍然很大程度上未被探索。我们引入了用于自适应解码的 微调 任意长度离散扩散(A2D2),这是一个用于任意长度离散扩散模型的奖励引导 微调 的统一框架,通过插入和揭露策略的联合优化以及基于质量的推理时间表。我们推导了联合插入-揭露路径测量的 Radon-Nikodym 导数,理论上保证收敛到棘手的奖励倾斜序列分布,而不需要目标样本。在此基础上,我们将揭露和插入质量建立为最小化解码错误的易处理方法,并引入自适应联合解码(AJD)损失,这可证明产生生成奖励倾斜分布的最佳路径度量。根据经验,A2D2 改进了奖励优化,同时比之前的固定长度 微调 和推理时间指导方法增强了生成灵活性和准确性。