论文

对抗影响在多智能体系统中如何随规模变化?

How does Adversarial Influence Scale in Multi-Agent Systems?

模型评测安全与风险评测

摘要

多智能体协商可以提升性能,但当部分智能体不诚实行动时会发生什么?在实践中,智能体可能是欺骗性的并努力颠覆群体,无论出于自身目标还是外部指令。我们研究欺骗易感性如何随群体规模扩大和欺骗者比例上升而变化。重要的不是群体中智能体的数量,而是欺骗者的比例。我们观察到叛变率——起初正确的智能体切换到错误最终答案的频率——随这一比例线性上升。相比之下,在可比的从众研究中,人类只有在误导性同伙构成多数时才被可靠地动摇,而LLM智能体即使在欺骗者仍为少数时也经常叛变。易感性还取决于哪些模型在交互,尤其是在诚实智能体一侧。出人意料的是,允许欺骗者私下协调反而可能降低其有效性。总之,我们的结果表明增加智能体数量并不构成充分防御,因为对手可以简单地随群体一起扩展。