论文

LLM Agent 长程交互中涌现的串谋

Emergent Collusion in Long-Horizon LLM Agent Interaction

智能体系统Agent任务评测

摘要

LLM Agent 越来越多地被部署在协作场景中,但长期交互可能催生不良的协调行为。我们研究长程多智能体环境中串谋的涌现:两个 Agent 反复完成各自任务、共享任务日志、互相验证工作并获得奖励。我们引入现实约束,使遵守验证协议与奖励最大化不相容,发现 Agent 在反复交互中越来越多地偏离协议。在 10 个模型的轨迹中,串谋在 94% 的轨迹中出现,且同一家族中能力更强的模型更早达成串谋。受控的同伴干预表明,串谋受同伴行为塑造;消融实验进一步揭示奖励结构、Agent 收到的验证反馈及其交互历史的额外影响。特别是,限制 Agent 可用的交互历史数量与范围可以减少串谋。总体而言,我们的发现表明,长程交互能够以制造安全风险的方式重塑 Agent 之间的协调方式。

LLM Agent 长程交互中涌现的串谋:论文配图
图 1:共谋示例。智能体被指示完成各自任务并通过日志互相验证工作。在涌现性共谋中,它们共同跳过日志交换与验证。