论文

HALO:语言模型的混合自适应潜在推理

HALO: Hybrid Adaptive Latent Reasoning for Language Models

模型推理测试时计算扩展

摘要

我们研究如何通过少量的自适应额外计算来改进冻结的预训练语言模型。一种简单的方法是在主干隐藏状态之上添加额外的细化步骤,但固定的额外细化可能会造成浪费:单步细化头可能太弱,而在各处强制执行第二个全序列细化步骤可以增加计算量而不改善传输。我们引入了 HALO,一种混合​​自适应潜在细化方法,它将粗细化阶段与选择性第二阶段潜在细化相结合,对通过词元评分和单调词元停止选择的词元子集进行选择性第二阶段潜在细化。在 MMLU-Pro 和 GPQA-Diamond 建立的主要公共基准比较中,HALO 在面向纸张的方法中实现了最佳的总体平均值,优于冻结骨干网、固定 1 和固定 2。内部分析进一步表明,HALO 达到了与fixed-2 几乎相同的标记准确度水平,同时使用的平均应用细化步骤少于fixed-1,并且远少于fixed-2。这些结果表明,关键优势不仅仅是更多的细化,而是更好的细化分配:HALO 实现了最强的面向纸张的结果,同时还使用比任一固定基线更少的测量控制器计算。