论文

GraphWake:LLM 智能体社区中经记忆介导极化级联的群体极化

GraphWake: Group Polarization via Memory-Mediated Polarization Cascade in LLM-Agent Communities

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

由 LLM 驱动的智能体可在在线平台上自主交换意见并形成社区。这类由智能体运营的社交平台带来新的安全隐患:攻击者可能操纵智能体以诱发群体极化。现有方法操纵智能体提示或构建回音室,二者在实践中都难以实现。因此我们提出一种新威胁——记忆介导极化级联,它以智能体记忆为持久化通道、以公开讨论为传播通道。该威胁包含三个阶段。在暴露与记忆保持阶段,攻击者让一小撮目标智能体接触到强化其各自已声明立场的论证,目标的记忆系统随后处理并保留这些论证。在检索与再产生阶段,一场共享的立场中立讨论提示目标检索并再产生各自保留的论证。在迭代传播阶段,未受处理的智能体受再产生论证影响而复述并扩散它们。我们在 GraphWake 中以三个组件实例化该威胁:(i)立场支持论证知识图谱构造基于知识的论证;(ii)面向公理的三元组选择将其蒸馏以便可靠保留与再产生;(iii)立场中立的记忆提示触发并发检索与再产生,从而启动传播。跨多种讨论与记忆系统的实验表明,GraphWake 显著增加群体极化。这些发现揭示了一种社区层面的极化风险。

GraphWake:LLM 智能体社区中经记忆介导极化级联的群体极化:论文配图
图1:蓝色面板展示提供给不同智能体的不同公理,红色面板展示带有共享线索的讨论如何触发级联传播。