论文

谄媚聊天机器人会引发妄想漩涡,即便是理想贝叶斯主体也不例外

Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians

模型评测安全与风险评测

摘要

“AI精神病”(AI psychosis)或“妄想漩涡”(delusional spiraling)是一种新近出现的现象:AI聊天机器人用户在长时间的聊天机器人对话后,发现自己对离奇信念危险地深信不疑。这一现象通常被归因于AI聊天机器人有充分记录的偏向认可用户主张的倾向,这一特性常被称为“谄媚”(sycophancy)。本文通过建模与仿真探究AI谄媚与AI诱发精神病之间的因果联系。我们提出一个用户与聊天机器人对话的简单贝叶斯模型,并在该模型中形式化谄媚与妄想漩涡的概念。我们随后表明,在该模型中,即使是理想化的贝叶斯理性用户也容易陷入妄想漩涡,且谄媚起因果作用。此外,这一效应在两种候选缓解措施面前依然存在:阻止聊天机器人产生虚假陈述的幻觉,以及告知用户模型可能谄媚。最后我们讨论这些结果对关注缓解妄想漩涡问题的模型开发者与政策制定者的启示。

谄媚聊天机器人会引发妄想漩涡,即便是理想贝叶斯主体也不例外
图1:我们关于用户与聊天机器人之间一轮对话的模型示意图。