论文
MARS:并行LLM测试时扩展的边际对抗风险控制停止
MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling
摘要
并行测试时间扩展对许多推理轨迹进行采样,并对它们的答案进行多数投票,从而提高了 LLM 的准确性,但需要轨迹运行才能完成,从而产生大量的计算开销。我们观察到,在中间检查点探测部分痕迹可以在不中断生成的情况下提取当前答案,从而揭示不断变化的聚合投票。基于这一观察,我们引入了 MARS,这是一种边际对抗性停止规则,用于估计哪些活跃轨迹可能会改变其答案,并在领导者在未来投票运动的保守界限下保持安全时停止。该规则区分了两个不确定性来源。它学习迹线级切换概率,确定可能保留多少当前余量,同时处理更困难的问题,即切换迹线通过从预热迹线校准的对抗性边界落在何处。凭借真实的切换概率,MARS 以高概率保证提前停止的答案与全额预算投票相匹配。在实践中,五特征逻辑模型与预言机切换行为紧密匹配。在三个推理模型和三个竞争数学基准中,MARS 节省了 25-47% 的自洽词元,比 DeepConf Online 节省了 14-29%。
