论文
TRACES:标记推理步骤以实现适应性成本高效的提前停止
TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping
摘要
过去几年,语言推理模型 (LRM) 领域非常活跃,训练和推理技术的进步使 LRM 能够推理更长时间、更准确。然而,越来越多的研究表明,LRM 仍然效率低下、过度生成验证和反思步骤。此外,每个推理步骤的高级作用以及不同步骤类型如何有助于生成正确答案,在很大程度上尚未得到充分探索。为了应对这一挑战,我们引入了 TRACES(标记推理步骤,实现自适应成本高效的早期停止),这是一个轻量级框架,可以实时标记推理步骤,并实现大型语言模型推理的自适应、经济高效的早期停止。通过监控推理过程中的推理行为,我们发现 LRM 在得出正确答案后往往会改变其推理行为。我们证明,对特定类型步骤的监控可以产生有效的可解释的早期停止标准。根据三个数学推理基准(MATH500、GSM8K、AIME)和两个知识和推理基准(MMLU 和 GPQA)进行评估,TRACES 实现了 20% 到 50% 的标记减少,同时保持与标准生成相当的准确性。在较困难的任务(BeyondAIME、IMO AnswerBench)上,准确性与效率的权衡更加陡峭,需要更保守的提前停止阈值。这项工作提供了一种研究和控制 LRM 生成行为的新方法。