论文

无关外部内容也可能改变LLM的决策

Reading Too Much into Context: Passive Exposure Can Steer LLM Decisions

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 助理现在可以在完成用户请求的同时搜索网络并查阅外部资源。这些来源可以提供有用的证据,但它们也可以将额外的内容引入模型的上下文中。即使添加的内容没有提供改变决策的理由,这种被动暴露能否引导决策?我们检查了具有和不具有此类外部内容的相同任务的模型决策的稳定性。在我们测试的所有开放权重和封闭权重模型中,暴露会系统地改变决策,在封闭权重模型中影响达到近 50 个百分点。同样的模式也出现在现实世界的在线观点中。这种影响也超出了主观偏好。这种暴露可能会引导模型做出违反明确用户要求的选择,并增加他们对虚假声明的接受度。简而言之,进入LLM背景的内容可以影响其决定,即使它不应该决定它。