论文
通过洞察重放实现有状态推理
Stateful Reasoning via Insight Replay
摘要
思维链(CoT)推理已成为引出大语言模型多步推理的基础,但近期研究表明其收益并不随链长单调增长:更长的CoT通常使模型能应对更难的问题,但在给定问题上,准确率通常随CoT长度提升至某一点后转而下降。我们识别出这一现象的一个主要原因:随着CoT增长,模型对轨迹中较早产生的关键洞察的注意力逐渐减弱,使这些洞察在最需要时越来越难以获取。为此,我们提出InsightReplay,一种有状态推理方法:模型周期性地从其推理轨迹中提取关键洞察,并在活跃生成前沿附近重放它们,使这些洞察在推理规模扩大时仍可获取。在覆盖模型规模{8B, 30B}、模型家族{Qwen3.5, DeepSeek-R1-Distill-Qwen, Gemma-4}和推理基准{AIME, HMMT, GPQA Diamond, LiveCodeBench v5}的2×3×4基准网格上的大量实验表明,3轮InsightReplay在全部24种设置中都带来准确率提升,相对标准CoT平均提高+1.65分,单设置最大增益为+9.2分,出现在R1-Distill-32B的LiveCodeBench v5子集上。我们的结果表明,测试时扩展的有效性不仅取决于模型推理多少,还取决于关键中间洞察在长推理轨迹全程中是否保持可获取。