论文
避免思考过度和思考不足:LLM 的课程感知预算安排
Avoiding Overthinking and Underthinking: Curriculum-Aware Budget Scheduling for LLMs
摘要
通过扩展推理扩展测试时计算已成为提高 大语言模型 (LLM) 功能的关键范例。然而,现有方法在固定或均匀采样 词元预算 下优化推理,忽略了问题难度和分配计算之间的根本不匹配。这会导致对简单问题的思考过多,而对困难问题的思考不足,从而导致在不同的推理场景中词元效率不理想。在本文中,我们提出了预算自适应课程推理(BCAE),这是一个统一框架,通过三个协同组件共同优化推理质量和词元效率:(1)\emph{预算条件统一策略},将 词元预算 嵌入作为连续条件信号,消除了解耦思维和总结策略的需要; (2)一个\emph{课程感知预算调度器},它根据实时学习进度自适应地将训练预算分配从简单问题转移到困难问题; (3)\emph{截断感知密集奖励}机制,通过过程级验证在中间推理步骤提供细粒度的奖励归因。我们进一步引入\emph{预算条件优势估计}(BCAE),这是一种新颖的方差减少技术,可以根据采样预算来调节优势基线,从而产生更稳定的政策梯度。数学推理基准(MATH、GSM8K、AIME 和 Minerva Math)的实验表明,BACR 在所有 词元预算 上始终优于其他强大的基准,在紧张的预算下实现了高达 8.3% 的准确率提升,同时与无约束推理相比,平均词元消耗减少了 34%。