论文

AERA:面向高效测试时推理的自适应证据残差分配

AERA: Adaptive Evidence Residual Allocation for Efficient Test-Time Reasoning

模型推理测试时计算扩展

摘要

测试时间扩展通过生成额外的候选解决方案来改进语言模型推理,但为每个问题分配相同的推理预算在计算上是浪费的。现有的自适应停止方法通常依赖于置信度、一致性或答案稳定性,隐含地假设更强的当前证据表明进一步的计算是不必要的。我们表明,这种假设可能会失败:检查点级别的正确性非单调地演变,并且可观察到的证据可能会在答案崩溃之前增强,或者在答案恢复之前减弱。受这种不匹配的推动,我们引入了自适应证据残差分配(AERA),这是一种顺序控制器,可以学习额外的计算是否有可能从检查点可观察的证据中恢复更好的答案。 AERA 使用答案分布、时间、重新求解、语义和计算特征来表征累积响应前缀,并反复决定是否停止或分配下一个响应块。未来检查点的正确性仅用于构建离线监督,并且在推理时永远无法提供给控制器。在 GSM8K 和 GPQA Diamond 中,AERA 识别特定问题的剩余机会,同时大幅减少推理计算。在对 300 个未触及的 GSM8K 问题进行的冻结阈值增量生成评估中,AERA 的准确率达到 92.61%,而 128 个响应的准确率则为 93.01%,同时将完成标记减少了 95.99%。这些结果表明,自适应推理应该估计计算的未来价值,而不是将当前的置信度与正确性等同起来。

AERA:面向高效测试时推理的自适应证据残差分配:论文配图
图2 航空和航天局的经验动机和概览可观察的证据可能与正确性相反:在崩溃期间,证据有时会加强,在恢复期间也会削弱。因此,AERA对每个观察到的检查前缀作了描述,并依次估计下一个检查站是否仍然有用。