论文

CogBias:度量与缓解大语言模型中的认知偏差

CogBias: Measuring and Mitigating Cognitive Bias in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型(LLM)正日益被部署于高风险决策场景。尽管已有研究从行为层面表明LLM存在认知偏差,但这些偏差是否对应可识别的内部表征、能否通过针对性干预加以缓解,仍是悬而未决的问题。我们将LLM认知偏差定义为在具有可计算真值基线的任务中对正确答案的系统性、可复现偏离,并推出LLM CogBias基准,它围绕判断、信息处理、社会和响应四类认知偏差家族组织。我们评估了三个LLM,发现认知偏差在全部四个家族中系统性出现,其幅度与去偏响应高度依赖家族类型:提示词层面的去偏能显著降低响应类偏差,但对判断类偏差却适得其反。利用对比设计下的线性探针,我们证明这些偏差以线性可分方向的形式编码在模型激活空间中。最后,我们应用激活导向来调制偏差行为,在保持25个基准上下游能力的同时,将偏差分数(有偏响应占比)降低26%-32%(Llama:性能退化可忽略;Qwen:判断类偏差上最多-19.0pp)。尽管不同模型的偏差表征近乎正交(平均余弦相似度0.01),激活导向在不同架构上降低偏差的速率却相近(r(246)=.621,p<.001),表明存在共享的功能组织。

CogBias:度量与缓解大语言模型中的认知偏差:论文配图
图 4:层-层相似性热图显示 D1 各层偏差方向 𝐯ℓ\mathbf{v}_{\ell} 之间的余弦相似性(判断偏差)。非对比探测(图 1、图 3)显示出高度的非对角线相似性(Llama/Qwen 的平均值为 0.18/0.14),产生表面图案检测的块结构特征。对比探测(图 2、图 4)显示,远处层的非对角线相似性降至 0.3 以下,而高相似性 (>>0.7) 仅限于相邻的中间层 (L35–L45),提供了真正的特定于层的偏差编码的证据。