论文

ENTRA:基于熵的大语言模型推理冗余规避

ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning

模型训练强化学习

摘要

大型推理模型(LRM)常受过度思考(overthinking)困扰,即使对简单任务也会生成不必要冗长的推理链。这带来大量计算开销而性能收益有限,主要源于冗余验证与重复生成。已有工作通常约束输出长度或优化正确性,这类粗粒度监督难以引导模型实现简洁而准确的推理。本文提出ENTRA,一个基于熵的训练框架,在保持性能的同时抑制冗余推理。ENTRA首先用轻量的Bidirectional Importance Estimation(BIE)方法估计token级重要性,该方法兼顾预测置信度与前向影响。随后它基于低重要性token的熵计算冗余奖励,并用其理论上界归一化,再通过强化学习优化该奖励。在数学推理基准上的实验表明,ENTRA将输出长度减少37%至53%,且准确率无损失——在某些情况下还有提升。我们的方法为减少LRM的过度思考提供了有原则且高效的解决方案,并为冗余感知的推理优化提供了可泛化的路径。

ENTRA:基于熵的大语言模型推理冗余规避
图3:基于 Qwen3-8b 的各方法压缩分析