论文

对抗性信息流可将LLM智能体的决策引向违背其默认立场

Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults

模型评测安全与风险评测

摘要

LLM智能体越来越多地在消费排序后的外部信息流(如社交动态、搜索结果、检索上下文和邮件队列)之后才采取行动,但安全评估几乎总是孤立地测试模型或用户提示,从不测试决定智能体在行动前读什么的上游排序器。我们引入一个受控协议:固定模型、人设、主题和最终决策提示,只改变智能体在之前十轮“刷屏”阶段所接触帖子的构成与排序,从而隔离信息流策展对下游决策的因果效应。在来自三个独立实验室的四个现代开源指令LLM上共2,785次决策rollout中,我们识别出三种响应模式:对抗性屈服、默认饱和,以及一种默认方向不对称性——单边信息流能扭转模型真正举棋不定的决策(最清晰的情形中从5%变为100%;Fisher p低至3 x 10^-10),却无法撼动模型已经倾向或坚定持有的立场。该效应遵循剂量-响应曲线,在排除写作风格伪象的生成器替换实验下依然成立,可泛化到多个决策领域——包括移除部署审批门禁或放宽访问控制等安全相关选择——并可被两种简单的信息流层防御部分缓解;前沿模型则保持其默认立场。我们将推荐器刻画为LLM智能体一个实用且以默认立场为边界的控制面,并主张智能体评估必须审计信息流层,而不能只看最终提示。

对抗性信息流可将LLM智能体的决策引向违背其默认立场:论文配图
图 1:对抗性饲料注射改变了 4 个现代LLM中的 2 个的决策。条形图显示有机随机基线下的 P⁡(推荐完全远程)P(\text{推荐完全远程}) 与大量 pro-RTO 注射相比,威尔逊 CI 为 95%。显着性标记(Fisher 精确,两侧):*** p<0.001p<0.001,** p<0.01p<0.01,n.s.不重要。