论文
SABER:通过对抗分支探测实现稳定性感知的大语言模型推理提前退出
SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing
摘要
大型推理模型(LRM)实现了强大的推理能力,但一旦中间答案在推理步骤中稳定下来,长链推理就会变得低效:额外的推理产生的边际效益很小,同时会产生大量的推理成本。现有的基于置信度或熵的提前退出方法很难捕获推理稳定性,而基于一致性的方法依赖于多步轨迹一致性,需要延迟退出的顺序评估。为了更好地平衡效率和可靠性,我们提出了 SABER,这是一种无需训练的框架,用于通过对抗性分支探测实现稳定性感知的早期退出。 SABER 围绕中间推理状态构建简单而有效的语义扰动以形成对抗性分支,并应用轻量级探测来估计其可能的最终结果,而无需完整的轨迹生成。当各分支的探测结果保持一致时,SABER 会提前退出;否则,它继续推理。跨多个推理基准和模型架构的实验表明,SABER 平均减少了 30.2\%--39.8\% 的推理词元消耗,同时通过全长推理保持有竞争力的准确性。
