论文
HRBench:混合推理LLM思考模式切换策略的基准测试与理解
HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs
摘要
混合推理大语言模型(LLM)提供了对推理力度的显式控制,使用户或系统能够在答案质量与推理成本之间进行权衡。然而,现有的自适应思考模式选择方法通常在不同模型、数据集和实现假设下评估,难以比较其实际表现。我们提出HRBench,一个用于研究混合推理LLM思考模式切换的统一评估框架。HRBench沿两个轴组织设计空间:三类切换策略家族——基于提示的选择、外部路由与投机执行,以及四种训练模式——免训练、SFT、离线与在线RL,共形成12个受控评估设置。我们在从Qwen3.5-2B到Kimi-K2.5-1.1T的6个LLM和覆盖数学、科学与代码的5个推理基准上评估这些设置,并在同一流水线中复现了12个以上代表性先前方法。我们的分析刻画了不同切换策略如何占据不同的效果-效率权衡区域:基于提示的方法常提供有利的token-准确率权衡,路由方法带来更稳定的成本削减,而投机方法倾向于以更高token成本换取准确率提升。我们进一步发现,训练对不同策略的影响各异,且优选策略随模型规模与任务领域而变化。HRBench提供参考实现与统一评估平台,以支持对混合推理LLM高效推理更受控的研究。我们的数据、代码与仓库发布于https://github.com/usail-hkust/HRBench。
