论文
思维惯性:LLM在被告知不要思考时仍会继续思考
Thinking Inertia: LLMs Keep Thinking When Told Not To
摘要
大型语言模型(LLM)越来越多地带有明确的“思维模式”,但其对应的“无思维”却受到的关注要少得多。我们沿着两个轴研究LLM的无思考行为。一个。如何衡量无思考?先前的工作通常通过诸如禁用思维模式或缺乏长痕迹等代理来定义无思考。这些代理是不可靠的:残疾的思维模式可能仍然会发出推理,而长痕迹可能包含填充物而不是真正的推理。相反,我们将每个响应标准化为预回答轨迹和最终答案,并在三个级别对其进行评估:(i)空想率,严格仅回答合规性; (ii) 指令感知问题-预回答相关性,用于问题和预回答轨迹之间的相似性; (iii) LLM作为法官的显式推理可见率。这些指标共同区分了仅答案输出、相关但非推理文本以及显式推理。 b.无思考在不同任务和模型中有何不同?我们评估了对六名LLM的六种提示干预措施,涉及布尔、 多项选择题和开放式问题。我们发现明确的无思考控制不能可靠地消除可见的推理。相反,模型表现出“思维惯性”:即使在严格控制下,显式推理仍然存在,并且随着答案空间的开放而变得更加普遍。布尔和多项选择任务的准确性保持稳定,而开放式任务则揭示了仅回答合规性和任务准确性之间的权衡。在答案空间中重写相同的问题表明,提供候选答案使得只回答答案变得更容易。这些发现将不思考确立为一种重要的能力:停止显式推理不能仅从模型设置或指令中假设出来,值得与推理能力一起进行系统评估。