论文

熵-梯度反转:走向大推理模型的内部机制

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

模型训练强化学习

摘要

大推理模型(LRM)的进展催化了一场范式转变:从反应式的“快思考”文本生成转向系统性、逐步推进的“慢思考”推理,解锁了复杂数学与逻辑任务上的最先进性能。然而,该领域面临token级行为分析与内部推理机制之间的根本鸿沟,以及用于推理优化的强化学习(RL)依赖昂贵外部验证器而带来的不稳定性。我们识别并正式定义了熵-梯度反转(Entropy-Gradient Inversion),即token熵与logit梯度之间稳健的负相关,它可作为LRM推理能力的确定性几何指纹。在此基础上,我们提出相关正则化组策略优化(CorR-PO),将这一反转特征嵌入RL奖励正则化之中。在多个模型规模的各种推理基准上的大量实验表明,CorR-PO持续优于最先进的基线,证实更强的反转与更优的推理性能直接相关。

熵-梯度反转:走向大推理模型的内部机制:论文配图
图 1:熵梯度反演图示。顶部:在基本模型中,输出熵和 logit 梯度表现出无显着相关性,显示为 Spearman ρs\rho_{s} 和 pearson rr 相关系数 。底部:推理模型演示了熵梯度反转,作为向慢思维过渡的指纹。