论文

MARS:并行LLM测试时扩展的边际对抗风险控制停止

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

模型推理测试时计算扩展

摘要

并行测试时间扩展对许多推理轨迹进行采样,并对它们的答案进行多数投票,从而提高了 LLM 的准确性,但需要轨迹运行才能完成,从而产生大量的计算开销。我们观察到,在中间检查点探测部分痕迹可以在不中断生成的情况下提取当前答案,从而揭示不断变化的聚合投票。基于这一观察,我们引入了 MARS,这是一种边际对抗性停止规则,用于估计哪些活跃轨迹可能会改变其答案,并在领导者在未来投票运动的保守界限下保持安全时停止。该规则区分了两个不确定性来源。它学习迹线级切换概率,确定可能保留多少当前余量,同时处理更困难的问题,即切换迹线通过从预热迹线校准的对抗性边界落在何处。凭借真实的切换概率,MARS 以高概率保证提前停止的答案与全额预算投票相匹配。在实践中,五特征逻辑模型与预言机切换行为紧密匹配。在三个推理模型和三个竞争数学基准中,MARS 节省了 25-47% 的自洽词元,比 DeepConf Online 节省了 14-29%。

MARS:并行LLM测试时扩展的边际对抗风险控制停止:论文配图
图 1:左图:在自我一致性 (SC) 和 DeepConf Online(Fu 等人,2025)投票下,MARS 在三个模型(DeepSeek-R1-8B、Qwen3-32B、Qwen3-next-80B)和三个竞赛数学基准上实现的词元节省,同时匹配准确性。误差线显示各问题的置信区间为 95%。右:MARS 在 HMMT Q22 (DeepSeek-R1-8B) 上运行。上图:跨探测器的投票份额演变。底部:最小松弛(约束挑战者余量减去对抗阈值);当松弛过零时,MARS 停止,保留正确答案并节省 59% 的词元。