论文

CAPS:面向高效并行推理的级联自适应成对选择

CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning

模型推理测试时计算扩展

摘要

并行推理——生成器采样多个候选解、聚合器选出最优——是大语言模型测试时扩展最有效的形式之一,而成对自验证已成为其最强的聚合原语。然而成对验证代价高昂:每次评判都要完整读取两个解,现有方法每个问题执行数十次这样的评判,而不论比较是否有信息量。我们提出CAPS(Cascaded Adaptive Pairwise Selection),一个纯推理框架,沿两个正交轴非均匀分配验证器算力:证据轴自适应裁判查看每个候选的多少内容,分布轴自适应比较如何在候选池中铺开。CAPS将其实现为带可选救援子程序的四阶段级联,并具有闭式验证器token成本,其中单个候选的边际成本相对均匀全证据方案约减半。在四个自验证模型(Qwen3-14B、GPT-OSS-20B、Qwen3-4B-Instruct/Thinking)与五个覆盖代码(LiveCodeBench-v5/v6、CodeContests)和数学(AIME 2025、HMMT 2025)的推理基准上,CAPS在20个套件中的14个上超越领先的成对验证器,同时在代码上仅用其25.4%的验证器token预算,并在全部20个套件上优于逐点自验证。折衷套件可依据验证器在部分证据与全证据下的准确率进行可解释的诊断,为级联适用性提供了具体的部署前检查。