论文
定向检索、紧凑表示:CoT 推理如何改进长上下文计数
Targeted Retrieval, Compact Representations: How CoT Reasoning Improves Long-Context Counting
摘要
在思维链 (CoT) 推理的支持下,大语言模型 (LLM) 在长上下文任务中得到了快速改进。然而,这种改善背后的内部机制仍不清楚。我们通过大海捞针(NIAH)计数任务来研究这些机制,其中要求大语言模型计算长文本中分散的记录数量。在 12 个模型比较组中,思考(或推理)比非思考提高了计数准确性,并且在计数较多时效果显着。这激发了我们的机制分析,该分析确定了两种对比机制:(i)广泛检索,其中非思维模型广泛关注多个针; (ii) 有针对性的检索,其中思维模型使用 CoT 轨迹中的枚举来连续检索针。有针对性的检索将注意力集中在单个针上,并伴随着更紧凑的内部表示。此外,因果干预分析表明,即使没有明确的编号,思维模型也会在针被连续检索时使用 CoT 轨迹来维护和更新内部计数器。在小型对照实验中,检索机制和计数器状态都在标准自回归训练下出现。总之,我们的结果将长上下文检索与计数的表示几何联系起来,支持 CoT 推理的状态跟踪解释。