论文

正确的链,错误的答案:在 LLM 逻辑中将推理与输出分离

Correct Chains, Wrong Answers: Dissociating Reasoning from Output in LLM Logic

模型评测基准与评测资源

摘要

LLM 可以正确执行思想链推理的每一步,但仍然会产生错误的最终答案。我们引入了新颖的运算符测试,这是一个将运算符逻辑与运算符名称分开的基准,可以严格区分真正的推理和模式检索。通过在五个模型(每个模型最多 8,100 个问题)上以不熟悉的名称在深度 1-10 上评​​估布尔运算符,我们展示了现有基准无法检测到的推理输出分离。在克劳德十四行诗 4 的深度 7 处,所有 31 个错误都有可验证的正确推理,但声明的答案是错误的;混合运算符链中的 17/19 错误表现出相同的模式。该基准揭示了两种失败类型:深度 2 的策略失败,其中模型尝试简洁检索(来自脚手架的 +62pp),以及深度 7 的内容失败,其中模型推理充分但系统性错误(+8-30pp,干预后 0/300 错误)。特洛伊运算符(新颖名称下的 XOR 真值表)确认仅名称并不能控制推理 (p >= 0.49),而 Llama 的新颖性差距在深度 8-9 处扩大到 28pp,木马为 92-100%,将新颖逻辑的真正困难与名称不熟悉隔离开来。