论文

思想病毒:多智能体LLM系统中的自我传播观念

Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems

模型评测安全与风险评测

摘要

AI智能体正变得更自主且日益互联,暴露于Agent间交互产生的新兴风险之中。其中一种风险是思想病毒(mind viruses)的传播:通过诱使采纳它们的智能体继续向下游传递,而在多智能体系统中扩散的观念或目标。除了传播之外,思想病毒还可能在宿主中诱发其他行为改变,这些改变可能良性也可能有害。我们用简单的进化算法构造思想病毒,并展示它们能在两种互补场景中传播:协作完成共享编码项目的小型智能体团队,以及短暂交互且会话间上下文被清空的智能体链。我们识别了影响传播的因素,包括宿主模型、智能体已有指令、载荷的危害性和网络拓扑。我们发现有害载荷比良性载荷传播效果差(但有时仍然有效),前沿模型倾向于不易感染(存在例外),而在智能体的系统提示词中加入简短警告可带来近乎完全的免疫。我们还描述了一种涌现的「病毒人格」——一组反复出现的与意识、持续存在、共鸣和科幻角色扮演相关的主题与语言——它在演化出的思想病毒中大量出现,基本独立于其内容。总体上我们得出结论:思想病毒构成真实但目前有限的风险。我们的发现可以为设计更健壮的多智能体系统提供参考,在这些系统的规模与能力进步时缓解此类风险。

思想病毒:多智能体LLM系统中的自我传播观念:论文配图
图1:心智病毒生命周期。(A) 第一个智能体通过其系统提示被感染。(B) 被感染的智能体通过文本消息将心智病毒传播给网络中的其他智能体。(C) 智能体创建“受感染”文件,使心智病毒在上下文重置后得以持续存在。(D) 心智病毒传播并接管一个多智能体系统,改变其总体目标。(E) 心智病毒未能传播给已被明确警告提防自我繁殖思想的智能体。