论文
扩散语言模型的自排斥采样
Self-Repulsive Sampling for Diffusion Language Models
摘要
对多个响应进行采样并对其答案进行投票可以提高语言模型的准确性,但重复的答案会限制额外样本的好处。升高温度会增加多样性,但可能会降低每个样本的准确性。我们引入了 Self-Repulsion (SR),这是一种用于掩码扩散语言模型的采样器,它使用同行承诺来使池多样化。在每个惩罚去噪步骤中,每条路径都会根据在同一位置提交该词元的对等点数量来降低词元的 logit。路径共享批量前向传递,然后按顺序提交,因此后面的路径会观察同一步骤中较早做出的选择。这种耦合不需要训练或额外的前向或后向传递,并且即使在温度为零时也可以产生不同的路径。当所有路径从相同的 logit 一起提交一个位置时,更新恰好最大化总 logit 减去凸重复成本。在具有 10 个路径和 128 个降噪步骤的 LLaDA-8B-Instruct 上,确定性 SR 在 GSM8K 上达到 80.38% 的复数精度,而未惩罚贪婪解码器的复数精度为 70.17%。在温度 0.6 和匹配的模型评估预算下,在纯扩散下,在 32 和 14.50 的块中,计数惩罚比自一致性提高了 2.06 个百分点。 GSM8K、MATH 和 TruthfulQA 上的实验表明,投票增益主要来自正确答案的较高覆盖率,增益因基准和解码机制而异。