论文
连续潜在扩散推理
Reasoning with Continuous Latent Diffusion
摘要
连续扩散通过潜在空间中的迭代细化生成完整的推理解决方案。我们引入潜在流推理模型 (LFRM),这是一种基于 ELF 的训练和推理方法。我们的实验表明,仅靠准确解码并不能确保强大的推理性能。因此,我们从强大的自回归教师的多层中学习紧凑的表示。它们的分解还能够以不同的速率进行异步降噪。我们表明,提示编码只需要保留正确的文本条件分数所需的信息,而不是完全匹配教师特征,并使用分阶段课程来学习紧凑的提示编码器,以在推理时取代教师 Transformer。我们采用 DiffusionNFT 来学习自我调节指导,并结合黄金解决方案端点来补充稀疏奖励。我们的监督模型在数学推理和 HumanEval 代码生成方面的表现优于最近在可比较的骨干规模上连续扩散基线的报告结果。凭借 638M 参数的去噪主干和学习的即时调节,NFT 后的 LFRM-L 在 64 个去噪步骤中在 GSM8K 上实现了 63.74% pass@1,在 MATH500 上实现了 24.6%,在 128 个去噪步骤中在 HumanEval 上实现了 32.85%,在 HumanEval+ 上实现了 30.18%。代码可在以下位置获取:https://github.com/chengxiang/LFRM