论文

LLM决策中的表观信念

Superficial Beliefs in LLM Decision-Making

模型评测模型行为与机制分析

摘要

我们询问大型语言模型(LLM)在两个选项之间进行选择时是否只是模仿基本原理,或者它们的选择是否反映了系统性的底层决策结构。使用综合二元决策设置,其中模型在分级属性定义的配置文件之间进行选择,我们将模型认为最重要的属性与最能解释其在符合先前决策的行为模型下的选择的属性进行比较。行为模型可以很好地预测保留的选择,这表明模型行为与可见属性系统相关,而不是随机的。然而,直接自我报告和单独的基于分数的判断只能部分恢复行为推断的驾驶员。由此产生的图像既不是一种任意行为,也不是一种完全明确的信念——输出的结构足以支持预测,但明确的原因只能不完美地跟踪恢复的驾驶员。这种定性模式在提示顺序和采样扰动、替代行为模型、有针对性的遮挡分析和结构变化的决策设置中持续存在。我们将此解释为大语言模型决策中“肤浅信念”的证据:模型的行为就好像受属性上的概率局部优先级的指导,而对驱动其决策的属性只有有限的口头访问。

LLM决策中的表观信念:论文配图
图 1:药物主题的单个真实样本和输出的图示。提示因空格而缩写,但所有其他值均来自非思考 (NT) 设置中的 GPT-5-mini。 (详情参见第 3 节)。