论文
RankGuide:面向高效推理的张量秩引导路由与转向
RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning
摘要
大推理模型(LRM)通过生成显式的多步骤思维链(CoT)推理来增强解决问题的能力;然而,它们会产生大量的推理延迟和计算开销。为了缓解这个问题,最近的工作探索了模型协作范例,其中小型推理模型(SRM)生成中间推理步骤以实现更好的准确性 - 延迟权衡。尽管最近取得了进展,但有效且高效地检测和减轻协作系统中的 SRM 故障仍然是一个关键挑战。为了解决这个问题,我们分析了生成的文本和隐藏状态空间中的 SRM 推理,并识别了三种类型的失败模式:\textit{过度自信}、\textit{不确定性}和 \textit{重验证}。基于这些见解,我们提出了 \textbf{RankGuide},这是一个通过张量秩引导的路由和引导来提高 SRM-LRM 协作的效率和有效性的框架。具体来说,RankGuide 利用包含从连续隐藏状态导出的张量秩信号的路由信号来检测 SRM 何时可能失败并有选择地调用 LRM。此外,我们引入了张量秩过滤的转向向量提取方法来调制SRM的推理轨迹,从而提高其生成质量。通过张量秩信号改进路由和转向,RankGuide 使 SRM-LRM 协作系统能够以更少的步骤实现更高效的推理并提高准确性。多个推理基准的实验证明,与 LRM 相比,RankGuide 能够将延迟减少高达 1.75 美元\倍$,同时保持相对于先前方法的竞争准确性。