论文

Fork-dLLM:避免扩散语言模型中的灵活性陷阱

Fork-dLLM: Avoiding the Flexibility Trap in Diffusion Language Models

模型推理解码与生成控制

摘要

掩码扩散语言模型 (dLLM) 与基于置信度的采样器相结合,通过并行标记生成显示出更快推理的强大潜力。然而,最近的工作表明,此类方法可以推迟揭露存在多个合理延续的高熵分叉位置。这会导致生成多样性减少(如 pass@k 缩放更差所示),并限制从 RL 训练后获得的增益。为了避免这种灵活性陷阱,之前的工作提倡使用自回归(AR)采样。在这里,我们表明放弃基于置信度的采样是不必要的,而且一旦考虑到推理成本,就会造成浪费。我们首先提出 Fork-dLLM,一种简单的混合采样器,仅在不确定的后备步骤中使用 AR 风格的排序,而在其他情况下保留并行生成。然后,我们将相同的原则扩展到 ForkGRPO 的后训练,它使用 Fork-dLLM rollout并仅在后备步骤中应用 GRPO 目标,保留精确的策略似然比,同时大幅降低rollout和优化成本。在我们的实验中,Fork-dLLM 与 AR 采样的强大 pass@k 缩放相匹配,同时效率提高了 2-3 倍,并且 ForkGRPO 以低得多的训练成本实现了与基于 AR 的 GRPO 基线相当或更好的下游性能。