论文
是什么让思维链在探测时发挥作用?局部共现而非全局推导
What Makes Chain-of-Thought Work at Probe Time? Local Co-occurrence Rather Than Global Derivation
摘要
思想链 (CoT) 提示可靠地提高了语言模型的准确性,但人们对基本原理文本的哪些属性推动了这种改进知之甚少。之前的工作主要研究了一代人的行为。相反,我们提出一个探索时间问题:给定上下文中固定的基本原理,该文本中的什么会改变答案?我们确定了两个互补的增益来源。首先,即使是全局词洗牌的基本原理也大大优于无基本原理的基线,表明具有很强的词汇激活效应。更重要的是,结构化文本的额外收益似乎较少来自句子级逻辑顺序,而更多来自短程标记邻接。保留仅 $n^\star{=}2$-$3$ token的连续窗口可以恢复大部分剩余收益,以实现全面的 CoT 性能。支持实验排除了复制明确的答案声明或答案值以及完整的语法实现作为主要驱动因素。进一步的泛化实验表明,定性模式在多个模型系列、参数尺度和数据集中保持稳定。这些结果支持探测时间 CoT 的局部共现激活 (LCA) 解释,其中观察到的增益似乎主要来自词汇激活和短程标记共现,而不是句子级逻辑推导。