论文

打破自回归诅咒:动态认识熵 orchestrating 的可擦除强化学习

Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs

模型训练强化学习

摘要

虽然强化学习(RL)拓展了大语言模型(LLM)的认知边界——但它在长程逻辑推理中常易受自回归诅咒影响:生成早期引入的小认识扰动可沿马尔可夫决策流不可逆传播——触发级联失败——把推理轨迹推向崩溃。为克服这种单点早期错误危害全部后续推理步骤的自回归级联——我们提出动态认识熵 orchestrating 的可擦除强化学习(E³RL)。E³RL以模型内生的局部自回归交叉熵为认识不确定性的内在坐标——消除对外部信号的依赖。经引入段级自适应动态阈值与优势分配——E³RL使模型能精确切除局部逻辑缺陷——同时复用历史KV缓存流——从而赋予推理过程自愈能力。我们在DeepMath-103k数据集上训练E³RL。实验结果表明E³RL重塑长序列推理的探索效率——在保持线性内存开销的同时改进样本效率。在AIME等数学推理基准上——E³RL取得显著性能增益:4B与8B参数模型分别超越先前SOTA结果5.349%与6.514%。这些发现表明E³RL打破了长序列推理中的自回归诅咒——并为下一代自愈AGI建立理论与系统级基础。

打破自回归诅咒:动态认识熵 orchestrating 的可擦除强化学习:论文配图
图 2:E3​RL\text{E}^{3}\text{RL} 概述。