论文

ESTAR:面向高效推理的早停式token感知推理

ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference

模型训练强化学习

摘要

大型推理模型(LRM)通过生成长思维链取得最先进性能,但在已经得到正确答案之后,常把计算浪费在冗余推理上。我们提出面向token感知推理的早停方法(ESTAR),检测并减少此类推理冗余,在不牺牲准确率的情况下提升效率。我们的方法结合:(i) 基于轨迹的分类器,识别推理何时可安全停止;(ii) 监督微调,教LRM提出自行生成的<stop>信号;(iii) <stop>感知强化学习,以计算感知的奖励在自行生成的停止点截断采样。在四个推理数据集上的实验表明,ESTAR把推理长度缩短约3.7倍(从4,799到1,290),同时保持准确率(74.9%对74.2%),并具有强的跨域泛化能力。这些结果凸显早停是提升LRM推理效率的一种简单而有力的机制。

ESTAR:面向高效推理的早停式token感知推理
图2:ESTAR能够预测应在何处终止CoT。(a) 冗余推理、(b) 标准高效推理方法、(c) 我们提出的基于LightGBM的冗余检测的示意。绿色文本:必要的思考步骤——推理中模型首次得出正确答案的部分。蓝色文本:冗余思考步骤——在已经得到正确答案之后生成的额外思考,往往重复甚至具有误导性。紫色文本:停止信号——指示模型应在何处终止推理的特殊token。红色文本:最终答案——模型完成其推理过程后选定的输出。