论文

通过范畴结构上的习得启发式实现自适应测试时算力分配

Adaptive Test-Time Compute Allocation via Learned Heuristics over Categorical Structure

模型推理测试时计算扩展

摘要

测试时计算已成为大语言模型(LLM)推理进步的主要驱动力,但正日益受到昂贵验证的制约。在许多推理系统中,很大一部分验证器调用被花费在冗余或无望的中间假设上。我们研究验证成本受限设定下的推理,探讨应如何在各中间状态之间分配验证投入。我们提出一个状态级选择性验证框架,它结合:(i) 结构化移动接口上的确定性可行性门控;(ii) 使用习得状态距离与残差评分混合的预验证排序;(iii) 基于局部不确定性的验证器调用自适应分配。与解级别的best-of-N或均匀的中间验证不同,我们的方法把验证分配到信息量最大的地方。在MATH基准上,我们的方法在验证器调用减少44%的情况下,取得高于best-of-N、多数投票与束搜索的准确率。

通过范畴结构上的习得启发式实现自适应测试时算力分配
图1:总体框架。