论文

当更多采样受到损害时:测试时间缩放的模态上限和相关性上限

When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

模型推理测试时计算扩展

摘要

人们想得太多了;语言模型过度采样,额外的努力可能会让两者得到更糟糕的答案。推理系统通过多次采样(测试时间缩放)来回答一个难题,并且它们绘制的越多,正确答案就越频繁地出现在某个地方,因此覆盖率(至少一次正确尝试的问题比例)不断攀升,似乎是一种进步。但是部署的系统必须返回一个答案,并且在不知道哪种尝试是正确的情况下选择它就是选择;选择是有上限的,超过一点,额外的样本只会让模型更加确信错误,即使每次抽签都会增加成本。攀登覆盖范围和停滞选择之间的差距,即可识别性差距,是模型可以产生但不能选择的答案。所以真正的问题不是是否采样而是采样多远,答案是:不远。为了选出答案,投票已经在几十个抽签之内就确定了,这是众数上限;为了获得基准,更早的是相关性上限。除此之外,额外的抽奖会消耗计算成本并且不会增加任何内容,甚至可能使答案变得更糟。本文将截止值转化为单个数字,即任何采样运行都已揭示的有效样本数。瓶颈在于识别正确答案,而不是生成正确答案。