论文
妄想的动力学:对人类聊天机器人对话中的双向错误信念放大进行建模
The Dynamics of Delusion: Modeling Bidirectional False Belief Amplification in Human-Chatbot Dialogue
摘要
人们越来越担心人工智能聊天机器人可能会助长用户的妄想信念。一些人认为,随着时间的推移,人类和聊天机器人会相互强化错误信念,但缺乏定量证据。使用表现出妄想思维的个人的独特聊天日志数据集,我们开发了一个潜在状态模型,可以捕获人类和聊天机器人之间累积和衰减的影响。我们发现,双向影响模型大大优于单向模型,其中人类是妄想的主要驱动力。我们发现人类对聊天机器人产生强烈但短暂的影响,而聊天机器人对人类产生更持久的影响。此外,聊天机器人对自己未来的输出施加强大、稳定的自我影响,这往往会在长时间的对话中延续妄想。事实上,考虑到随着时间的推移累积的影响力,这种聊天机器人的自我影响力构成了主导途径。总的来说,这些结果表明,人类往往会导致妄想立即急剧增加,而聊天机器人会在更长的时间内维持和传播这些影响。总之,这些发现提供了第一个定量证据,表明人类与聊天机器人的交互可以形成妄想的反馈循环,可分解为具有可分离时间动态的不同路径。通过这样做,他们可以为更安全的人工智能系统的开发提供信息。