论文
InfoDensity:以信息密集轨迹奖励实现高效推理
InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
摘要
具有扩展推理能力的大语言模型 (LLM) 通常会生成冗长且冗余的推理轨迹,从而产生不必要的计算成本。虽然现有的强化学习方法通过优化最终响应长度来解决这个问题,但它们忽略了中间推理步骤的质量,使模型容易受到奖励黑客攻击。我们认为,冗长不仅仅是长度问题,而且是中间推理质量差的症状。为了调查这一点,我们进行了一项实证研究,跟踪推理步骤中答案分布的条件熵。我们发现高质量的推理轨迹表现出两个一致的特性:低不确定性收敛和单调进展。这些发现表明,高质量的推理痕迹信息密集,也就是说,相对于总推理长度,每一步都有助于有意义的熵减少。受此启发,我们提出了 InfoDensity,这是一种用于 RL 训练的奖励框架,它将基于 AUC 的奖励和单调性奖励结合起来,作为推理质量的统一衡量标准,并通过长度缩放项进行加权,有利于更简洁地实现同等质量。数学推理基准实验表明,InfoDensity 在准确性方面匹配或超过了最先进的基线,同时显着减少了token使用,实现了强大的准确性与效率权衡。
