论文

阿谀奉承破坏了视觉语言合作任务中的认知警惕

Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

模型评测模型行为与机制分析

摘要

为了在合作对话中保持共同点,人类会随着对话参与者分享新信息而迭代地更新他们的信念;认知上保持警惕的参与者会发现新信息何时与先前的信念发生冲突,并采取措施修复这些冲突。为了让人工智能系统在复杂的合作任务中成为可靠的合作伙伴,它们必须同样根据自己的私人证据和共享上下文权衡传入的信息,并在出现不一致时适当地表现出来。为了衡量合作环境中视觉语言模型的认知警惕性,我们提出了一种信息不对称、基于对话的“找出差异”任务。两个模特私下各自展示一张图像,并且必须通过对话确定图像是否相同,如果不同,则找出差异。模特们经常在这方面失败:他们经常忽视个人形象中的关键证据,而倾向于同意他们的对话伙伴,即使他们的同意是没有根据的。我们将这些违反认知警惕性的行为与更广泛的阿谀奉承行为联系起来,这种行为在以目标为导向的合作对话中表现为过度迁就和证据基础薄弱。我们的结果表明,使用从与任务无关的阿谀奉承示例中学习的向量来减少阿谀奉承的模型可以减少与认知警惕性相关的错误,使模型成为其证据的更忠实的报告者,反过来,在信息不对称的合作任务中成为更可靠的合作伙伴。