论文
重新思考密集的顺序链:推理语言模型可以从稀疏的、顺序打乱的思想链中提取答案
Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts
摘要
现代推理语言模型隐含地假设每个词元都有贡献并且步骤必须按顺序消耗,从而生成密集的、连续的思想链轨迹。我们通过系统干预管道(删除、屏蔽、洗牌和噪声注入)挑战这两个假设,并将其应用于跨三个模型和三个基准的模型生成的推理链。我们的发现在三个方面都是违反直觉的。顺序:推理链的顺序对于答案提取重要吗?无行级改组使准确度降低不到 0.5 pp;词级改组保留 62%-89% 的准确率;只有 词元级 洗牌崩溃到接近于零。仅预训练和指令调整的变体表现出几乎相同的容差(行改组下为 78.67% 与 78.00%),表明顺序无关源于预训练而不是特定于推理的 微调。 Dense:推理链中的所有信息对于答案提取都很重要吗?不——屏蔽数字会使准确度下降到 0%,而屏蔽字母散文的准确度提高了 4.7 个百分点。 鲁棒性:同时具有顺序洗牌和非密集的推理链是否仍然鲁棒?是的——最积极地减少表示(删除所有自然语言,任意打乱行)仍然达到 83% 的准确率,并且以 3 倍真实答案频率注入错误答案使准确率保持不变 (83.3%->83.3%),伪造了基于频率的提取帐户。这些结果表明,答案提取在稀疏、顺序不敏感且结构稳健的信息基础上进行,为并行和词元高效的推理生成开辟了道路。