论文

确认我们的偏见?评估 大语言模型 的能力、风险和社会影响

Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models

模型评测模型行为与机制分析

摘要

众所周知,大语言模型 (LLM) 对提示框架敏感,反映了训练数据或先前提示中的模式。在本研究中,我们调查了 LLM 在多大程度上强化了提示中表达的用户偏见,并检查了隐式框架效应和显式提示操纵之间的界限。具体来说,我们评估 LLM 对鼓励模型支持或挑战特定立场的直接和暗示性提示的敏感程度。我们使用 160 个不同的提示来评估 6 个 LLM,涵盖基于观点和事实领域的 10 个主题。这些提示在提示策略、支持与挑战指令、提示极性、用户表达的信念和主题领域方面系统地不同,涵盖基于观点的问题和事实问题。我们的结果表明,即使在实际情况下,LLM 也会系统地调整他们的反应,以与提示框架保持一致。这表明,在模型响应中,及时的框架可能比事实的一致性更重要。总的来说,我们的研究结果描绘了 LLM 可操纵性的范围和界限。此外,结果表明 LLM 可以强化微妙的用户偏见,并且即使在响应应保持事实上稳定的领域中也容易受到明确的提示操纵。