论文

HyperGuide:面向大语言模型高效多步推理的双曲引导

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

模型训练监督微调与指令调优

摘要

多步推理仍是大语言模型的核心挑战:单次生成高效但精度不足;树搜索方法探索多条路径但计算开销大。我们通过将推理进度蒸馏为一种双曲几何信号、用以引导逐步生成来弥合这一差距。我们的方法源于一个结构性观察:在组合推理树中,含解状态稀少而死路呈指数级众多。双曲空间恰好匹配这种不对称性——靠近原点处体积紧凑,向边界呈指数扩张——因此到原点的距离自然编码解的接近程度,而角向间隔区分需要不同后续操作的分支。我们训练一个轻量级头将LLM隐状态投影到该空间,然后在模型自身的推理尝试上交互式微调低秩适配器,使其能作用于注入的信号。在多个基准上,该几何信号带来一致收益,且在更深的推理链上改进更大。代码已公开于 https://github.com/yuyuliu11037/HyperGuide。

HyperGuide:面向大语言模型高效多步推理的双曲引导:论文配图
图 1:架构概述。第 1 阶段(上):投影头 hphih_{\phi} 将推理树状态嵌入到庞加莱球 𝔻cn\mathbb{D}^{n}_{c} 中,以便到原点的距离跟踪到解的距离,并且成对测地距离跟踪树的距离。第 2 阶段(底部):在 fθf_{\theta} 和 hphih_{\phi} 冻结的情况下,每个状态 sts_{t} 被编码为 𝐳t\mathbf{z}_{t} 并由 gψg_{\psi} 提升为虚拟令牌,在步骤 t+1t{+}1 之前拼接到残差流中。 LoRA 适配器在模型自己的部署上进行训练,并使用树预言机提供每个状态的目标操作。