论文

打破障碍:通过强化学习的单调熵下降实现扩散 大语言模型 的动态大小推理块

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning

模型训练强化学习

摘要

最近的扩散 大语言模型 (dLLM) 通过基于块的半自回归生成范例证明了推理的有效性和效率。尽管取得了进步,固定大小的块生成仍然是有效和连贯推理的关键瓶颈。 1. 从全局角度来看,不同的推理任务将对应不同的最佳解码块大小,这使得“一刀切”的假设无效。 2. 即使在单个推理任务中,严格的块划分也会破坏逻辑流程并降低推理的连贯性。通过经验观察,我们发现,对于块级熵,错误的推理在块之间表现出波动和不稳定的趋势,而正确生成的任务遵循一致的下降趋势。因此,本文提出了 b1,一种用于 dLLM 的新型 后训练 框架,通过单调熵下降目标学习动态大小推理块,并通过强化学习来增强推理一致性。b1 作为即插即用模块与现有 dLLM 的 后训练 算法无缝集成。跨各种推理基准的广泛实验展示了 b1 相对于现有固定大小块基准的持续改进。我们的代码已发布在https://github.com/YanJerry/Block-R1。