推理中的测试时间缩放 LLM:推理机制、评估和再现性
Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
摘要
大语言模型 可以通过更多的推理时间计算来解决更困难的推理问题。然而,术语“测试时间缩放”涵盖了几种推理算法:沿着一条轨迹扩展审议,对已完成的候选者进行采样并通过投票或验证来聚合它们,以及搜索部分状态。这些算法在统计结构、计算要求和故障模式方面有所不同。在标量“预算”下将它们视为可互换的,或者在不指定推理协议的情况下报告准确性,使得研究结果难以进行比较。我们沿着三个轴研究测试时间缩放。首先,我们将其形式化为对自回归模型的隐式前缀树的预算推理,并区分单轨迹顺序缩放、具有终端缩减的叶级缩放和前缀级缩放。其次,我们将完整的推理系统视为评估对象,并将端到端性能与候选库诊断分开。我们引入了一种评估配置文件,其坐标和简单函数恢复或绑定常见的重复采样指标,并且需要与协议相匹配的计算会计和不确定性估计。第三,我们区分精确重放和分布再现性,并说明两者的要求。我们还通过模型端和接口机制组织开放权重推理模型。我们的实证研究涵盖了广泛的知识、符号推理和竞争数学,并且我们公开发布了 1,403,520 个样本模型尝试。该项目网站位于 https://mohsenhariri.github.io/scorio/tts。发布的数据集包括 Trace (https://huggingface.co/datasets/harimo/scorio-trace)、Lite (https://huggingface.co/datasets/harimo/scorio-lite)、Math (https://huggingface.co/buckets/harimo/scorio-math) 和 SuperGPQA (https://huggingface.co/buckets/harimo/scorio-gpqa)。