论文

LLM测试时计算扩展中的可解释自适应采样

Interpretable Adaptive Sampling for LLM Test-Time Scaling

模型推理测试时计算扩展

摘要

测试时间扩展提高了大语言模型的推理能力,通过生成和聚合多个候选答案。然而,许多管道使用固定的每查询预算,这些预算在容易和困难的问题上花费相同的计算资源。由于它们不解释为什么给定的问题收到特定数量的样本,因此很难检查这些固定预算。我们提出了一种自适应测试时间扩展的方法,该方法使用轻量级模糊控制器将可解释信号映射到每个查询的采样预算。控制器根据估计的提示复杂性以及模型信心分配较少的样本给容易或更确定的提示,而分配更多的样本给困难或不那么确定的提示,使推理时间内的计算资源可检查而不是固定的或不可见的。我们使用公平对齐协议进行评估,匹配解码设置和控制答案选择,并与最佳-$N$、计算感知扩展以及自信心基线在问题回答和数学推理任务上进行比较。无论模型还是数据集,自适应模糊控制器都优于几个标准基准,并且保持接近与全预算控制器匹配的平均样本数。这些发现表明,可解释的自适应采样是大语言模型中更有效测试时间推理的实际方向。

LLM测试时计算扩展中的可解释自适应采样:论文配图
图 1:自适应测试时间缩放管道。系统估计提示难度和不确定性,使用模糊控制器分配每个提示的采样预算,生成候选值,并选择最终答案。