论文
基于时间性推理聚合的高效测试时扩展
Efficient Test-Time Scaling via Temporal Reasoning Aggregation
摘要
测试时扩展提升了大语言模型的推理性能,但常导致词元低效的过度思考,即模型在正确答案所需范围之外继续推理。现有动态提前退出方法通常依赖单步置信度信号,而这类信号在多步场景下检测推理收敛往往不可靠。为缓解这一局限,我们提出TRACE,一个免训练的高效测试时扩展框架,它基于多步证据的时间聚合而非瞬时信号来决定何时终止推理。TRACE通过聚合近期推理步骤上的两个互补信号来检测推理随时间的收敛:一是答案一致性,捕捉预测答案的持续性;二是置信度轨迹,建模模型置信度的时间演化。得益于这两个因素,TRACE能准确判断推理过程是否已收敛,从而及时停止推理并有效避免冗余的推理步骤。在多个具有挑战性的基准上的大量实验表明,TRACE平均减少25-30%的推理词元用量,同时保持准确率与全长推理相差在1-2%以内,持续优于现有动态推理方法。
