论文

HyPER:通过假设路径扩展与归约衔接探索与利用以实现可扩展的 LLM 推理

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

模型推理测试时计算扩展

摘要

用多路径思维链扩展测试时计算可以提升推理准确率,但其效果关键取决于探索与利用的权衡。现有方法以僵硬的方式处理这一权衡:树结构搜索通过脆弱的扩展规则硬编码探索,干扰经过后训练的推理;并行推理则过度探索冗余的假设路径,并依赖薄弱的答案选择。基于“最优平衡依赖于阶段,且正确与错误的推理路径往往只在后期才分岔”这一观察,我们将测试时扩展重新表述为在一个假设池上的动态扩展-归约控制问题。我们提出 HyPER,一个面向混合专家(MoE)模型多路径解码的免训练在线控制策略,它在固定预算下利用轻量的路径统计量重新分配计算。HyPER 包含:一个随假设池演化从探索转向利用的在线控制器;一个无需全路径重采样即可在生成时高效利用的 token 级精炼机制;以及一个为可靠的答案期利用而设计的长度与置信度感知聚合策略。在四个混合专家语言模型和多个推理基准上的实验表明,HyPER 持续取得更优的准确率-计算权衡,准确率提升 8% 到 10%,同时 token 用量降低 25% 到 40%。

HyPER:通过假设路径扩展与归约衔接探索与利用以实现可扩展的 LLM 推理
图6:面向单 token 聚合的两遍专家采样。