论文
ParaTempo:基于时间置信度的高效并行推理
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence
摘要
并行推理通过探索多条求解路径提升大型推理模型的准确性与鲁棒性,但其计算成本随推理深度和分支数量增长。现有的并行路径管理方法通常依赖最终答案共识、局部token置信度或孤立的中间探针。然而,这些信号往往滞后、与实际推理进展关联较弱,或对动态的分支级控制而言过于嘈杂。为解决这些局限,我们提出ParaTempo,一个免训练的异步并行推理框架。ParaTempo由时间置信度驱动,这是一种分支局部的答案空间收敛度量。每个分支被周期性探询以获得暂定的答案概率分布,时间置信度量化最近的中间探针在主导答案上的集中程度。一旦积累了足够证据,ParaTempo便由这一单一信号驱动其整个控制过程:低置信度分支被剪枝,持续锁定主导答案的分支被提前退役,空闲计算通过分叉新分支进行再分配,当置信度加权投票集中时全局停止生成。无需推理轨迹间同步,ParaTempo基于分支级收敛自适应分配计算。在具有挑战性的数学与科学推理基准上的实验表明,ParaTempo把平均延迟降低21.8-32.2%、总token用量降低18.1-30.3%,同时保持有竞争力的准确率。此外,相比token级与瞬时信号,时间置信度对未来分支收敛表现出更强的时间稳定性和预测能力。
