论文
QuasiMoTTo:准蒙特卡罗测试时间缩放
QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling
摘要
通过为每个问题生成许多并行尝试来扩展推理计算,是提高语言模型能力的一种昂贵但可靠的手段。默认情况下,这些尝试是独立生成的,浪费了冗余解决方案的推理计算。这种浪费似乎是不可避免的。毕竟,独立性使得并行采样在规模上变得微不足道。然而,这种权衡并不是根本性的:采样器有丰富的设计空间,可以完全并行地生成相关但精确的样本。我们探索这个设计空间,作为提高扩展推理计算和强化学习(RL)样本效率的途径。具体来说,我们引入了 QuasiMoTTo,它使用相关样本作为 i.i.d 的直接替代品。样品。为了生成这些样本,QuasiMoTTo 使用自回归采样的重新参数化作为逆 CDF 采样,并使用准蒙特卡罗 (QMC) 绘制底层制服;由于 QMC 比 i.i.d. 更均匀地分布均匀性,因此生成的样本以少得多的冗余覆盖输出空间。尽管批次是相关的,但每个样本根据语言模型都是边际分布的,因此我们可以使用批次进行策略梯度训练。我们的实证分析侧重于了解 QuasiMoTTo 如何有效地将计算转化为性能。为了评估相关采样器(其依赖性打破了标准 pass@k 估计器),我们首先开发一个无偏引导估计器。在四个推理基准中,QuasiMoTTo 与 i.i.d 相匹配。 pass@k 准确率,样本减少 25-47%。引人注目的是,QuasiMoTTo 通常会饱和 pass@k 的上限,该上限适用于任何边缘保留采样器。我们还将 QuasiMoTTo 应用于策略梯度 RL (GRPO),它与 i.i.d 匹配。训练步骤减少 50% 的性能。这些收益来自于更高的覆盖率,这会在每批中产生更强的学习信号。