论文

经济地思考:LLM 中自适应复杂性推理的分层框架

Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs

模型推理测试时计算扩展

摘要

思想链 (CoT) 显着增强了 LLM 推理,但经常因“过度思考”而产生大量计算开销:生成过长的基本原理,而没有相应的准确性增益。现有的效率方法通常采用统一压缩,这忽略了一个关键的观察,即推理复杂性在两个不同的粒度上是异构的:跨不同问题和在单个推理步骤内。这激发了我们经济思考的原则:根据内在任务和步骤需求智能地分配计算资源,而不是追求统一的简洁性。我们提出了分层自适应预算器(HAB),这是一个通过从粗到细的预算来实施这一原则的训练框架。在步骤间级别,HAB 预测每个问题的最佳推理深度。在步内级别,HAB 从 PPL 派生的步骤比较和捕获局部质量效率权衡的自适应帕累托优化目标中学习特定于步骤的词元预算信号,而基于 Fisher 信息的剪枝器进一步提供细粒度的训练时间指导,从而鼓励生成器内化更经济的推理模式。在 GSM8K 和 MATH500 上的实验表明,HAB 不仅在准确性上超过了标准 CoT,而且还减少了词元使用量,实现了比比较基线更强的性能效率权衡。