论文

基于时间性推理聚合的高效测试时扩展

Efficient Test-Time Scaling via Temporal Reasoning Aggregation

模型推理测试时计算扩展

摘要

测试时扩展提升了大语言模型的推理性能,但常导致词元低效的过度思考,即模型在正确答案所需范围之外继续推理。现有动态提前退出方法通常依赖单步置信度信号,而这类信号在多步场景下检测推理收敛往往不可靠。为缓解这一局限,我们提出TRACE,一个免训练的高效测试时扩展框架,它基于多步证据的时间聚合而非瞬时信号来决定何时终止推理。TRACE通过聚合近期推理步骤上的两个互补信号来检测推理随时间的收敛:一是答案一致性,捕捉预测答案的持续性;二是置信度轨迹,建模模型置信度的时间演化。得益于这两个因素,TRACE能准确判断推理过程是否已收敛,从而及时停止推理并有效避免冗余的推理步骤。在多个具有挑战性的基准上的大量实验表明,TRACE平均减少25-30%的推理词元用量,同时保持准确率与全长推理相差在1-2%以内,持续优于现有动态推理方法。

基于时间性推理聚合的高效测试时扩展:论文配图
图 1:基于置信度的单步提前退出过早地停止在高置信度但不正确的中间预测处,而 TRACE 则避免了错误收敛并得出正确答案。绿色框表示正确答案,红色框表示错误答案。