论文

TrigReason:基于触发器的小型与大推理模型协作

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

模型推理测试时计算扩展

摘要

大型推理模型(LRM)通过延长的思维链在复杂任务上取得强劲性能,但因自回归推理而面临较高的推理延迟。近期工作探索利用小型推理模型(SRM)来加速LRM推理。本文系统刻画了SRM的能力边界,并识别出三类常见的推理风险:(1) 路径偏移,即SRM缺乏构建初始规划的战略能力,导致推理偏离最可能的路径;(2) 认知过载,即SRM无法解决特别困难的步骤;(3) 恢复无能,即SRM缺乏稳健的自我反思与纠错机制。为应对这些挑战,我们提出TrigReason,一个基于触发器的协作推理框架,用选择性干预取代持续轮询。TrigReason将大部分推理委托给SRM,仅在必要时激活LRM干预——在初始战略规划阶段(战略引导触发器)、检测到异常过度自信时(认知卸载触发器),或推理陷入无效循环时(干预请求触发器)。在AIME24、AIME25和GPQA-D上的评估结果表明,TrigReason达到与完整LRM及SpecReason相当的准确率,同时向SRM卸载多出1.70倍至4.79倍的推理步骤。在端云条件下,TrigReason将延迟降低43.9%,API成本降低73.3%。我们的代码已发布于 https://github.com/QQQ-yi/TrigReason

TrigReason:基于触发器的小型与大型推理模型协作:论文配图
(a) SpecReason 框架。(b) TrigReason 框架。(c) 准确率比较。(d) Token 使用百分比。(e) 延迟比较。图 1:SpecReason 和 TrigReason 之间的推理框架和性能评估概述。评估基于 AIME24 基准,使用 DeepSeek-R1-1.5B 作为 SRM,QwQ-32B 作为 LRM