论文
野外测试时间扩展:为什么瓶颈是利用而不是探索
Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck
摘要
测试时间缩放 (TTS) 通过花费额外的推理计算来改进语言模型输出 - 生成多个候选、搜索部分序列或迭代地细化草稿。这些技术在数学和代码方面产生了巨大的收益,但几乎专门针对验证简单的任务进行了开发和压力测试。我们对跨医学、法律、金融、一般聊天和创意写作等五个开放式生成基准的五个 TTS 系列进行了首次计算标准化比较,该比较基于一个统一的框架,该框架将每种方法的 词元预算 的有效性分解为探索和利用。答案取决于您检查分解的哪一方面。扩展探索有效:池中的最佳候选者通过所有设置的计算稳步提高。破坏的是利用——将丰富的候选池转换为最终输出的步骤。借助最先进的生成器,奖励模型与真实质量的关联度仅为 $ρ_v \approx 0.12$,无论预算如何,都会呈现近乎随机的选择。树搜索通过多样性崩溃放大了这种失败。细化有助于五个基准之一;它在其他地方的明显收益令人困惑。只有跨候选物的合成 (Fusion) 能够持续改进单样本基线,但仍然只能恢复约 40% 的可用质量。候选池不是瓶颈——从中进行选择才是瓶颈。