论文
ELF-REG:将连续扩散语言模型扩展到推理任务
ELF-REG: Scaling Continuous Diffusion Language Models to Reasoning Tasks
摘要
完全连续扩散语言模型 (dLM) 对连续表示进行去噪,无需中间离散化,然后在最后一步并行解码所有响应标记。与自回归 (AR) LLM 和 masked dLM 相比,它们在具有挑战性的推理任务上的表现仍然不太确定。我们将嵌入式语言流 (ELF) 扩展到 GSM8K、MATH-500、HumanEval 和 MBPP 上的数学推理和代码生成。我们引入了 ELF-REG,它通过表示对齐和纠缠 (REPA+REG) 来改进学习,其中冻结的 AR 教师监督中间降噪器特征,并提供与响应联合去噪的全局表示。 ELF-REG-L 在 64 次网络功能评估 (NFE) 中在 GSM8K 上实现了 55.96% pass@1,在 128 NFE 中在 MATH-500 上实现了 13.39%,在 HumanEval 上实现了 22.56%。它在 GSM8K 和代码上的 pass@1 中优于评估的可比规模 dLM,并将 MATH-500 pass@1 从 ELF-L 基线的 10.55% 提高到 ELF-REG-L 的 13.39%。无需进行几步训练,相同的特定于任务的检查点就可以通过提前停止来支持强大的低 NFE 性能,从而在不完成去噪轨迹的情况下解码中间干净的预测。在 16 NFE 时,ELF-REG-L 的 HumanEval pass@10 达到 41.21%,优于近期同等规模的连续 dLM。