论文

CoBa:基于计算均衡路由的高性价比测试时扩展

CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

模型推理测试时计算扩展

摘要

测试时扩展通常通过沿单一维度投入更多计算来实现:采样更多解答、延长思维链,或使用更强的评估器。在固定推理预算下,这些选择相互竞争。本文将测试时推理表述为一个计算分配问题:系统必须决定下一单位计算应花在生成、验证还是停止上。我们提出CoBa,一种计算均衡路由策略:先获得少量候选解,广泛施加廉价验证,并将不确定或高价值的候选路由给更强的验证。在涵盖MATH-500、AIME 2024/2025、AMC 2023和程序性符号推理的3,129次示例生成器评估中,CoBa-Routed-Strong达到85.13%的宏平均准确率,在统计上与85.20%的自评估加权投票代理持平,同时少用49.1%的参数加权token;它还与best-of-16多数投票在宏平均准确率上相差不超过0.01个百分点,同时少用58.9%的参数加权token,配对检验显示best-of-16在成本大幅更高的情况下仍保有小幅优势。配对自助法检验显示其相对单样本解码有显著增益,而与池化oracle的剩余差距则暴露了更精细路由的提升空间。对本地推理系统而言,测试时扩展变成“下一份计算用在哪里最有价值”的问题。

CoBa:基于计算均衡路由的高性价比测试时扩展:论文配图
图1:CoBa将测试时扩展视为计算分配。控制器使用可观察的不确定性、验证和预算特征,在每个状态于采样、轻量验证、强验证和停止之间进行路由。