论文

冗长思维链真的有帮助吗:内容而非长度才是关键

Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters

模型评测模型行为与机制分析

摘要

思维链(CoT)提示改善LLM推理,但来源有争议:中间步骤有帮助是因为携带有用的语义内容,还是因为条件在更多token上为模型承诺答案前购买了额外计算?我们提供两线证据。第一,分布内:对同一问题重复采样同一模型、把较短的与较长的自然生成配对——两者遵循相同推理计划、都真正在分布内。跨25个模型:额外token对每个独立训练的推理器的准确率基本无影响,盲分析显示存在的增益追踪的是验证与检查内容而非冗长本身。第二,作为受控干预:两段表达相同语义内容的轨迹(相同事实、操作与中间值经DAG等价验证)在更冗长时是否产生不同结果。冗长轨迹确实改善准确率(32个基准-目标单元中25个为正),但效应温和(通常1-4分)且取决于冗长散文的质量而非仅其长度。在最大数字脱敏下效应放大(四算术基准中位数3.24倍),而长度匹配的非推理填充恢复不了。两线收敛:重要的是额外token做了什么(其推理与验证内容),而非有多少。

冗长思维链真的有帮助吗:内容而非长度才是关键:论文配图
图 2:8 个基准测试和 4 个目标的 ΔL4–L1\Delta_{\text{L4--L1}}(详细 L4 减去简洁 L1)。左:E2 算法验证器(C 层未定义,显示为阴影线)。右:E3 LLM 评判(所有基准)。星号表示 95% 的引导 CI(不包括零)。色标围绕零对称;红色表示详细帮助,蓝色表示详细伤害。