论文
ESTAR:面向高效推理的早停式token感知推理
ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference
摘要
大型推理模型(LRM)通过生成长思维链取得最先进性能,但在已经得到正确答案之后,常把计算浪费在冗余推理上。我们提出面向token感知推理的早停方法(ESTAR),检测并减少此类推理冗余,在不牺牲准确率的情况下提升效率。我们的方法结合:(i) 基于轨迹的分类器,识别推理何时可安全停止;(ii) 监督微调,教LRM提出自行生成的<stop>信号;(iii) <stop>感知强化学习,以计算感知的奖励在自行生成的停止点截断采样。在四个推理数据集上的实验表明,ESTAR把推理长度缩短约3.7倍(从4,799到1,290),同时保持准确率(74.9%对74.2%),并具有强的跨域泛化能力。这些结果凸显早停是提升LRM推理效率的一种简单而有力的机制。
