论文

LLM 中的条件认知偏差:有偏见的用户如何调整上下文推理

Conditional Cognitive Biases in LLMs: How Biased User Turns Modulate In-Context Reasoning

模型评测模型行为与机制分析

摘要

我们在现实的多轮交互设置下对最先进的指令调整 LLM 中的认知偏差表达进行了评估。我们的工作引入了一种新颖的三条件实验框架,该框架将暴露于有偏见的用户转向的影响与转向语义内容的影响分开,同时还提供了涵盖 9x9 目标-人类偏见交互矩阵的所有 81 个单元格的 24,300 个经过陪审团验证的用户提示的基准。在八个前沿 LLM 中,我们发现在 8 个模型中的 6 个模型中,相对于零样本基线,有偏见的对话上下文系统地增加了偏见表达。我们确定了这种效应背后的两种相互竞争的行为动态:对话中暴露于偏见推理通常会放大下游偏见倾向,而明确陈述的偏见线索通常会触发与对齐相关的抑制行为,从而减少明显的偏见表达。我们发布了框架、代码库和数据集,以支持 LLM 中情境条件认知偏差和行为适应的未来研究。