论文
Hermes:学习情境推理可以解锁测试时计算扩展
Hermes: Learning Contextual Reasoning Unlocks Test-Time Scaling
摘要
测试时计算扩展通过在推理期间分配额外的计算来提高模型性能。跨多个上下文窗口有效地使用此计算需要决定如何分配新的上下文以及在它们之间携带哪些信息。我们将模型做出这些决策的能力称为上下文推理。现有的方法很大程度上通过其利用来规定这些决策。相反,我们将它们转移到模型中。我们介绍 1) Hermes,一系列简单、可配置的工具,可逐步改变对上下文分配和重用的模型控制;2) Hermes-Learn,一个用于学习这些功能的两阶段框架。我们发现,有能力的模型可以利用这种灵活性来通过额外的推理时间计算进行扩展,而较小的开源模型最初很难做到这一点。 Hermes-Learn 训练弥补了这一差距,引入了随问题和推理进度而变化的自适应上下文推理策略。这些收益可以跨基准测试和模型推广,超出训练过程中看到的推理时间计算范围,并转移到 Hermes 之外的补充测试时计算扩展方法。