论文
熵-梯度反转:走向大推理模型的内部机制
Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models
摘要
大推理模型(LRM)的进展催化了一场范式转变:从反应式的“快思考”文本生成转向系统性、逐步推进的“慢思考”推理,解锁了复杂数学与逻辑任务上的最先进性能。然而,该领域面临token级行为分析与内部推理机制之间的根本鸿沟,以及用于推理优化的强化学习(RL)依赖昂贵外部验证器而带来的不稳定性。我们识别并正式定义了熵-梯度反转(Entropy-Gradient Inversion),即token熵与logit梯度之间稳健的负相关,它可作为LRM推理能力的确定性几何指纹。在此基础上,我们提出相关正则化组策略优化(CorR-PO),将这一反转特征嵌入RL奖励正则化之中。在多个模型规模的各种推理基准上的大量实验表明,CorR-PO持续优于最先进的基线,证实更强的反转与更优的推理性能直接相关。
