论文
调度思想:学习扩散语言模型中的思想顺序
Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models
摘要
屏蔽扩散语言模型通过迭代地揭开标记进行解码,其中揭开顺序定义了一种“思想顺序”,它强烈影响生成质量,但通常是启发式选择的。我们推导了顺序解码失配的易于处理的上限,通过 Kullback-Leibler 散度进行测量,并以模型的路径对数似然表示,在足够的模型表达能力下具有紧密性。这种界限会在有序轨迹上产生密集的自我意识奖励,将订单选择视为具有冻结降噪器的原则性策略优化问题。我们将这个想法实例化为自我感知调度(SAS),它使用组相对策略优化来学习轻量级顺序策略,并无缝应用于任意顺序和半自回归解码。在使用 1B MDM 的数独游戏中,SAS 将谜题准确率从 82.0%(最佳启发式计划)提高到 91.8%,并且沿着学习轨迹使用第二阶段 微调 达到 97.5%。在使用 LLaDA-8B 进行数学推理时,SAS 将 GSM8K 上的 pass@1 从 64% 提高到 76%,将 MBPP 从 39.5% 提高到 41%,在代长度和块大小上始终匹配或超过启发式计划。项目页面:https://jimmyxu123.github.io/SAS