论文

通过预算多属性验证扩展测试时间

Test-Time Scaling via Budgeted Multi-Attribute Verification

模型推理测试时计算扩展

摘要

在共享计算预算下验证LLM生成的答案需要共同决定要检查哪些候选者以及要评估哪些验证属性。我们将这个问题表述为全球预算下的多属性好臂识别:每个候选者都是根据几个昂贵属性进行评估的臂,目标是验证尽可能多的候选者,其平均分数超过所有属性的规定阈值。我们提出 \textsc{BMA-GAI},一种将成本感知臂选择与属性自适应采样相结合的算法。每个观察结果既可以指导自适应分配,也可以支持随时有效的认证,从而无需单独的确认阶段。我们为 \textsc{BMA-GAI} 建立了渐近覆盖保证,并推导了一个匹配的信息论逆向来表征问题的内在复杂性,从而证明 \textsc{BMA-GAI} 是远离临界预算水平的一阶最优。综合基准​​和 LLM 答案验证任务的实验表明,与竞争方法相比,\textsc{BMA-GAI} 可以更有效地分配验证预算并认证更多高质量的候选者。