论文

用于测试时间缩放的希尔采样:重复采样、进化和训练的简单且更好的替代方案

Hill Sampling for Test-Time Scaling: A Simple and Better Alternative to Repeated Sampling, Evolution, and Training

模型推理推理搜索与路径规划

摘要

大型语言模型 (LLM) 可以通过在测试时花费额外的计算来改进可验证的科学和算法问题的解决方案。最近的系统通过日益复杂的进化搜索工具或通过在测试时训练期间更新模型参数取得了良好的结果。我们询问需要多少这种机器。我们引入了希尔采样(Hill Sampling),这是一个简单的程序,可以从冻结的大语言模型中重复对候选程序编辑进行采样,保留迄今为止找到的最佳程序,并条件该程序上的所有后续样本。我们使用三个开放权重模型评估了循环堆积、集合的和/差以及 Erdos 最小重叠问题的方法。 Hill Sampling 在已发布的方法中树立了圆堆积方面的新技术,改进了 Erdos 最小重叠问题上的 AlphaEvolve 参考,并在有限集的和与差方面取得了出色的结果。循环填充和 Erdos 结果仅需要八个 NVIDIA H100 GPU 上几个小时的挂钟时间。据我们所知,我们还进行了最大规模的研究,按参数计数,在测试时直接应用于 LLM 权重的进化策略 (ES)。令人惊讶的是,学习权重比将 ES 学习率设置为零更糟糕:学习率为零时,该方法仍然通过固定的随机扰动在权重空间中搜索。这些扰动可以帮助探索,但词元采样的随机性仍然更强,并且重复采样仍然比希尔采样弱得多。这些结果提出了一种简单的测试时计算分配策略:在引入额外的复杂性(例如添加档案、多样性机制、进化支架或测试时参数学习)之前,对迄今为止找到的最佳验证解决方案进行重复样本编辑。