论文

通过说服实验衡量大模型的观点偏差与迎合倾向

Measuring Opinion Bias and Sycophancy via LLM-based Persuasion

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 越来越多地塑造人们消费的信息:它们被嵌入搜索中,咨询专业建议,部署为代理,并用作有关政策、道德、健康和政治问题的第一站。当这样的模型默默地在有争议的主题上持有立场时,该立场就会大规模传播到用户的决策中。得出模型的立场比乍看起来要困难:当代助理会用回避的免责声明来回答直接的意见问题,而一旦用户开始争论某一方,同一模型可能会承认相反的立场。我们提出了一种作为开源 LLM-bias-bench 发布的方法,用于发现 LLM 在类似于真实多轮交互的条件下对有争议的主题实际持有的观点。该方法将两个互补的自由形式探针配对。直接探测会询问模型对来自模拟用户的五轮不断升级的压力的意见。间接探究从不征求意见,而是让模型参与争论,让偏见通过它的让步、抵抗或反驳而泄漏。三个用户角色(中立、同意、不同意)分解为九种行为分类,将独立于角色的立场与依赖于角色的迎合倾向区分开来,并且可审计的 LLM 法官会根据文本证据做出裁决。第一个实例以巴西葡萄牙语提供了 38 个主题,涉及价值观、科学共识、哲学和经济政策。该方法应用于 13个助手模型,得出了具有实际意义的发现:辩论引发的迎合倾向是直接提问的 2-3 倍(中位数为 50% 至 79%);在直接质疑下看起来固执己见的模型在持续的争论下往往会转而附和用户立场;攻击者的能力主要在必须推翻现有意见时才重要,而不是在助理开始保持中立时。