论文

GlimpRouter:通过窥视思维首个token实现高效协同推理

GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts

模型推理推理加速

摘要

大型推理模型(LRM)通过显式生成多步思维链取得出色表现,但这一能力带来可观的推理延迟和计算成本。协同推理通过在轻量模型与大型模型之间选择性分配工作提供了一个有前景的解决方案,但一个根本挑战仍然存在:如何判断某个推理步骤需要大模型的能力还是小模型的效率。现有路由策略要么依赖局部 token 概率,要么依赖事后验证,都会引入显著的推理开销。本文提出一种看待逐步协作的新视角:推理步骤的难度可以从它的第一个 token 推断出来。受 LRM 中“顿悟时刻”(Aha Moment)现象的启发,我们证明首个 token 的熵是步骤难度的一个强预测指标。基于这一洞察,我们提出 GlimpRouter,一个免训练的逐步协作框架。GlimpRouter 用轻量模型只生成每个推理步骤的第一个 token,仅当首 token 熵超过阈值时才把该步骤路由给更大的模型。在多个基准上的实验表明,我们的方法在保持准确率的同时显著降低推理延迟。例如,在 AIME25 上,与单独使用大模型相比,GlimpRouter 在准确率上提升 10.7%,同时将推理延迟降低 25.9%。这些结果表明一种简单而有效的推理机制:基于对思维的一瞥而非完整步骤评估来分配计算。

GlimpRouter:通过窥视思维首个token实现高效协同推理 配图
图 3:GlimpRouter 总体框架。协作推理流水线以逐步方式运行。在每个推理步骤开始时,SLM 首先生成一个“一瞥”(glimpse,即初始 token T_k)。GlimpRouter 随后计算该 token 的熵 H_init 以评估步骤难度。系统依据阈值动态路由生成过程:(1) 委托(Delegate,低 H_init):常规步骤完全由高效的 SLM 生成。(2) 介入(Intervene,高 H_init):预示认知转折的复杂步骤被路由给能力更强的 LLM 以进行稳健推理。最后,LLM 基于聚合的协作链生成最终答案。