论文
路径很重要:学习扩散语言模型的词元承诺策略
The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models
摘要
扩散 大语言模型 通过并行细化许多词元位置来承诺更快的生成,但这种并行性引入了一个隐藏的控制问题:哪些提议的词元应该在每一步转移到部分解码的序列中?我们将此决定称为词元承诺。现有的冻结生成器解码器很大程度上依赖于手工设计的置信规则或特定于块的接受过滤器。我们认为词元承诺可以作为可重用的跟踪状态策略来学习。我们引入了 TraceLock,这是一个轻量级插件控制器,可以为冻结扩散语言模型实例化此策略。由于预言机承诺时间不可用,TraceLock 从未来稳定性中获得自我监督:在解码步骤 t 中,如果位置 i 的提议词元在完整解码跟踪完成后与位置 i 处的最终词元匹配,则该词元被标记为稳定。控制器对可变长度跟踪状态进行评分,并决定哪些活动词元提案应提交给部分解码的序列。一旦针对给定的冻结主干进行了训练,控制器就可以跨本地窗口宽度、生成长度和步骤预算进行部署,而无需重新训练或按设置校准。问答、数学推理和代码生成的实验表明,TraceLock 改进了启发式和学习基线的质量步权衡,在跨设置部署下具有特别稳定的行为。诊断分析表明,其决策不能简化为标量置信度,这表明冻结扩散语言模型暴露了超出基于置信度的解码的可学习的承诺轨迹空间。代码可在 https://github.com/BobSun98/TraceLock 获取。