论文

以平衡思考实现高效推理

Efficient Reasoning with Balanced Thinking

模型推理测试时计算扩展

摘要

大推理模型(LRM)已经显示出卓越的推理能力,但它们经常会出现过度思考、在简单问题上花费冗余计算步骤,或者思考不足、尽管具有固有的能力但未能探索足够的推理路径。这些问题导致效率低下和潜在的不准确,限制了资源有限环境中的实际部署。现有的减轻过度思考的方法,例如抑制反思性关键字或调整推理长度,可能会无意中导致思考不足,从而损害准确性。因此,我们提出了ReBalance,一个免训练的框架,通过平衡思维实现高效推理。 ReBalance 利用信心作为推理动态的连续指标,通过高置信度方差识别过度思考,并通过一致的过度自信识别思考不足。通过将小规模数据集中的隐藏状态聚合到推理模式原型中,我们计算一个转向向量来引导 LRM 的推理轨迹。动态控制函数根据实时置信度来调节该向量的强度和方向,在过度思考时修剪冗余,并在思考不足时促进探索。对从 0.5B 到 32B 的四种模型以及数学推理、一般问答和编码任务的九个基准进行的广泛实验表明,ReBalance 有效减少了输出冗余,同时提高了准确性,为高效、稳健的 LRM 部署提供了通用、免训练和即插即用的策略。代码可在 https://github.com/yu-lin-li/ReBalance 获取。

以平衡思考实现高效推理:论文配图
图 3:ReBalance 框架图示。我们首先对小规模可见数据集执行离线一次性数据收集。在每一步中,基于置信度在指定层的第一个token处提取引导向量,并根据模型行为拟合动态函数。在部署过程中,动态函数根据模型的实时置信度在线输出转向权重,从而在过度思考和思考不足之间取得平衡。