论文
冗长思维链真的有帮助吗:内容而非长度才是关键
Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters
摘要
思维链(CoT)提示改善LLM推理,但来源有争议:中间步骤有帮助是因为携带有用的语义内容,还是因为条件在更多token上为模型承诺答案前购买了额外计算?我们提供两线证据。第一,分布内:对同一问题重复采样同一模型、把较短的与较长的自然生成配对——两者遵循相同推理计划、都真正在分布内。跨25个模型:额外token对每个独立训练的推理器的准确率基本无影响,盲分析显示存在的增益追踪的是验证与检查内容而非冗长本身。第二,作为受控干预:两段表达相同语义内容的轨迹(相同事实、操作与中间值经DAG等价验证)在更冗长时是否产生不同结果。冗长轨迹确实改善准确率(32个基准-目标单元中25个为正),但效应温和(通常1-4分)且取决于冗长散文的质量而非仅其长度。在最大数字脱敏下效应放大(四算术基准中位数3.24倍),而长度匹配的非推理填充恢复不了。两线收敛:重要的是额外token做了什么(其推理与验证内容),而非有多少。
