论文

LEAD:打破长程推理中的无恢复瓶颈

LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning

模型推理推理验证与自校正

摘要

即使提供了高层策略,大型语言模型(LLM)的长程执行仍然不稳定。在受控算法谜题上的评估表明,虽然分解对稳定性至关重要,但极端分解会造成"无恢复瓶颈"。我们表明,由于高度不均匀的误差分布——少数"困难"步骤上的一致性错误变得不可逆——这一瓶颈变得至关重要。为此,我们提出Lookahead-Enhanced Atomic Decomposition(LEAD)。通过引入短程未来验证并聚合重叠的rollout,LEAD提供足够的隔离以维持稳定性,同时保留足够的局部上下文以纠正错误。这使o4-mini模型能够解决复杂度高达n=13的Checkers Jumping,而极端分解在n=11之外即告失败。

LEAD:打破长程推理中的无恢复瓶颈
图5:跨模型在Checkers Jumping( n = 13 n=13 )上错误分布之间两两比较的热图,采用总变差(TV)距离度量。数值越高表示错误分布越不相似。对于DeepSeek,仅有一个估计可用,因此未报告自比较结果。