论文

Precedent-Informed Reasoning:通过测试时先例学习缓解大推理模型的过度思考

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

模型训练参数高效训练

摘要

大语言模型(LLM)的推理常受低效的长思维链拖累,其中充斥冗余的自我探索与验证,推高计算成本甚至降低性能。受人类推理模式启发——人们借助以往相关案例约束搜索空间、减少试错来解决新问题——我们提出 Precedent Informed Reasoning(PIR),将 LRM 的推理范式从穷举式自我探索转变为有先例引导的学习。PIR 解决两个关键挑战:采用哪些先例以及如何利用它们。首先,自适应先例选择(APS)为每个问题和每个 LRM 构建一个紧凑的先例集合,其中的先例既与问题语义相关又对该模型富有信息量。它以语义相似度与模型困惑度的联合得分对样例排序,并自适应调整先例数量以最大化困惑度下降。其次,测试时经验内化(TEI)被视为在先例知情指令上的测试时学习,通过更新轻量适配器来内化解题模式,并在后续推理中将其作为先验。在数学推理、科学问答和代码生成上的实验表明,PIR 在多个 LLM 上持续缩短推理踪迹,同时保持或提高最终准确率,带来出色的精度-效率权衡。

Precedent-Informed Reasoning:通过测试时先例学习缓解大型推理模型的过度思考
图1:不同推理范式的示意。不同于依赖自我探索的常规推理,precedent-informed reasoning利用先例经验来缩小搜索空间,从而提升推理效率。