论文
用于扩散语言模型的基于注意力的采样器
Attention-Based Sampler for Diffusion Language Models
摘要
自回归模型(ARM)已经在语言建模中建立了主导范式。然而,它们严格的顺序采样范式对推理效率和建模灵活性都施加了基本限制。为了解决这些限制,提出了基于扩散的 大语言模型 (dLLM),为并行采样和灵活的语言建模提供了潜力。尽管有这些优点,当前的 dLLM 采样策略主要依赖于 词元级 信息,这无法考虑全局序列结构,并且通常会产生次优结果。本文从对数似然最大化的角度研究采样顺序选择问题。我们证明这个问题是 NP 困难的,并提出了一种基于采样秩的最优近似,使目标在计算上易于处理。我们进一步证明,通过按注意力矩阵列总和的降序对标记进行采样,可以优化易处理的目标。这一发现为注意力引导采样提供了原则上的理由,并为贪婪搜索提供了一种有理论依据的替代方案。我们在称为 Attn-Sampler 的新 无需训练 采样算法中实例化了这一理论见解,并进一步提出了用于实际加速的动态注意力阈值。跨多个基准的大量实验验证了我们提出的方法的有效性,证明它在增强采样并行性的同时实现了卓越的生成质量。