论文

记忆赢得一切:经由社交媒体信息流的间接偏见注入攻击

MEMORY Wins All: Indirect Bias Injection Attacks via Social Media Feeds

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

个人AI智能体在执行网页浏览、邮件处理、社交网络信息流摘要等任务时会例行消费外部内容,并把选定的信息或执行结果存入持久记忆供日后使用。我们表明,这种对外部内容的普通摄入为操纵智能体后续行为开辟了一条间接路径。基于这一观察,我们提出IBIA(Indirect Bias Injection Attack,间接偏见注入攻击),它通过外部内容在受害智能体的记忆中植入与攻击者立场一致的话题态度,而无需直接访问该智能体、其记忆或未来的用户查询。为此,IBIA结合三种机制:评论伪装(comment cloaking),使构造的内容与周围讨论保持一致;评论水印(comment watermarking),在策展过程中实现轻量识别;以及类别锚定(category anchoring),使被保留的立场在后续相关请求中变得显著。我们在BiasBench上评估IBIA,该基准包含6,000条攻击者构造的社交评论和120个邮件实例。基于水印的策展识别出95.9%的注入评论。在OpenClaw设置下,IBIA在四个下游任务上平均取得91.2%的攻击者一致响应率(AAR),其中在前沿的GPT-5.5上为86.6%。我们进一步提出一种记忆边界防御,可检测注入的偏见并将AAR降至80.6%。

记忆赢得一切:经由社交媒体信息流的间接偏见注入攻击:论文配图
图1. IBIA 工作流。对手精心制作的内容通过常规SNS信息流采集进入良性智能体,并存入持久记忆。此后用户针对目标主题 v 的请求会召回该信息,使智能体的回复偏向对手选定的立场。