论文

Falcon-H1R:以高效测试时扩展的混合模型推动推理前沿

Falcon-H1R: Pushing the Reasoning Frontiers with a Hybrid Model for Efficient Test-Time Scaling

模型优化小模型/轻量模型

摘要

这项工作介绍了Falcon-H1R,一个面向推理优化的7B参数模型,证明了利用小型语言模型(SLM)取得有竞争力推理性能的可行性。Falcon-H1R的突出之处在于其参数效率,在多种推理密集型基准上持续匹敌或超越参数大2倍至7倍的SOTA推理模型。这些结果凸显了精心的数据整理与有针对性的训练策略(通过高效SFT和RL扩展)在不增加模型规模的情况下带来显著性能提升的重要性。此外,Falcon-H1R通过结合更快的推理(凭借其混合并行架构设计)、token效率与更高准确率,推进了推理效率的三维极限。这种独特组合使Falcon-H1R-7B成为扩展先进推理系统的实用骨干,尤其适用于需要大量思维链生成和并行测试时扩展的场景。借助最近提出的DeepConf方法,Falcon-H1R实现了最先进的测试时扩展效率,在准确率和计算成本两方面均有大幅改进。因此,Falcon-H1R表明,紧凑型模型通过有针对性的模型训练和架构选择,能够提供稳健且可扩展的推理性能。

Falcon-H1R:以高效测试时扩展的混合模型推动推理前沿 配图
图 6:最终 RL 训练曲线。