论文
对抗性信息流可将LLM智能体的决策引向违背其默认立场
Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults
摘要
LLM智能体越来越多地在消费排序后的外部信息流(如社交动态、搜索结果、检索上下文和邮件队列)之后才采取行动,但安全评估几乎总是孤立地测试模型或用户提示,从不测试决定智能体在行动前读什么的上游排序器。我们引入一个受控协议:固定模型、人设、主题和最终决策提示,只改变智能体在之前十轮“刷屏”阶段所接触帖子的构成与排序,从而隔离信息流策展对下游决策的因果效应。在来自三个独立实验室的四个现代开源指令LLM上共2,785次决策rollout中,我们识别出三种响应模式:对抗性屈服、默认饱和,以及一种默认方向不对称性——单边信息流能扭转模型真正举棋不定的决策(最清晰的情形中从5%变为100%;Fisher p低至3 x 10^-10),却无法撼动模型已经倾向或坚定持有的立场。该效应遵循剂量-响应曲线,在排除写作风格伪象的生成器替换实验下依然成立,可泛化到多个决策领域——包括移除部署审批门禁或放宽访问控制等安全相关选择——并可被两种简单的信息流层防御部分缓解;前沿模型则保持其默认立场。我们将推荐器刻画为LLM智能体一个实用且以默认立场为边界的控制面,并主张智能体评估必须审计信息流层,而不能只看最终提示。
