论文

阻力最小的路径:用前缀共识指导大语言模型重修轨迹

The Path of Least Resistance: Guiding LLM Reasining Trajectories with Prefix Consensus

模型推理推理搜索与路径规划

摘要

大语言模型取得强劲的推理性能,但自洽性(SC)等推理策略计算代价高昂,因为它们完整展开所有推理轨迹。我们提出PoLR(Path of Least Resistance),首个利用前缀一致性实现计算高效推理的推理时方法。PoLR对推理轨迹的短前缀聚类,识别主导簇,并展开该簇中的所有路径,在保留SC准确率收益的同时大幅降低token使用和延迟。我们的理论分析以互信息和熵为框架,解释了为什么早期推理步骤编码了对最终正确性具有预测力的强信号。实证上,PoLR在GSM8K、MATH500、AIME24/25和GPQA-DIAMOND上持续匹敌或超越SC,token使用最多减少60%,时钟延迟最多降低50%。此外,PoLR与自适应推理方法(如Adaptive Consistency、Early-Stopping SC)完全互补,可作为即插即用的预过滤器,使SC在无需模型微调的情况下显著更高效、更可扩展。

阻力最小路径:用前缀共识引导LLM推理轨迹
(a) PoLR 概览