论文
学会停止何时有帮助:推理模型早退的成本感知研究
When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models
摘要
推理模型跨实例不均匀地花费测试时算力,不断增长的早退规则家族——置信阈值、熵监视器、答案稳定性检查与学习型停止器——承诺收回浪费。但这些规则在异构协议下评估——使部署问题无人回答:在固定容许丢失正确答案的容忍度下,哪种策略节省更多算力?节省是否在探针开销后存活?我们以跨18个任务-模型设置的受控研究回答——涵盖GSM8K、MATH-500、MMLU-Pro、AIME-90与GPQA,使用Qwen3与DeepSeek-R1蒸馏模型,以LearnStop(在可从前缀观测的特征上的免隐状态逻辑停止器)作为学习策略工具。在α=0.15的匹配丢失正确风险下:学习型停止在全部四个主Qwen3自由格式数学设定中胜出(额外总token节省+3.2至+21.2分);校准标量退出在多选题MMLU-Pro上胜出;小型难基准(AIME-90、GPQA)无早退空间。