论文
从截断到承诺:统一离散扩散中的持久上下文
From Truncation to Commitment: Persistent Context in Uniform Discrete Diffusion
摘要
统一状态离散扩散模型并行更新所有词元,同时保持每个位置可修改。即使常用的 top-$p$ 规则在某个位置仅留下一个候选者,该选择也仅影响当前的反向步骤,并且可以在下一个采样步骤中进行修改。我们询问,当选定的假设成为后续预测的持久背景时,会发生什么变化。因此,我们建议使用承诺揭示采样(CRS),这是一个 无需训练 采样器,用于存储选定的 argmax 标记并将其插入后续模型输入中。我们的分析给出了稍后选择和保持所选标记可见的理由。在精确的前向过程中,选择干净词元的贝叶斯误差不会随着噪声的减少而增加,而在简单的潜在模式模型中,保持所选词元可见有助于以后的并行预测就相同的序列级选择达成一致。根据经验,对双蒸馏的配对实验将这种持续效应与单步 top-$p$ 限制和标量温度缩放分开。在相同的最终确定规则下,在 8--64 个函数评估 (NFE) 的预算中,没有 top-$p$ 截断的 CRS 达到的生成困惑度 (GenPPL) 低于固定 $p=0.95$ 和 $p=0.9$ 基线。在 64 NFE 处,匹配一元熵的比较也给出了 CRS 较低的 GenPPL,从而产生更有利的 GenPPL 熵权衡。 Base Duo 在描述性比较中显示了相同的方向,而其他多样性和连续性指标可以对这些操作点进行不同的排名。这些结果将支持限制和持久上下文确定为该权衡的不同控制。