论文
MADBench:多Agent辩论的安全性基准测试
MADBench: Benchmarking the Security of Multi-Agent Debate
摘要
多智能体辩论 (MAD) 可以通过允许多个智能体交换和批评他们对同一任务的答案来改进大语言模型 (LLM) 推理。然而,使智能体能够纠正错误的交互也会传播对抗性错误并引导智能体得出错误的答案。尽管已经做出了一些努力来检查 MAD 的特定攻击类型,但对不同攻击下的 MAD 进行系统评估仍然有限。一个核心问题是辩论是减轻还是放大对抗性影响。在本文中,我们提出了 MADBench,一个评估 MAD 安全性的基准。我们按照 MAD 工作流程将攻击组织成分层分类法,结合既定攻击和针对辩论量身定制的新策略。我们通过 356 个源任务和 3,958 个测试用例评估了 6 个攻击系列,检查它们对最终答案的影响和对抗性影响的传播。我们的结果表明,在受到攻击时,MAD 并不一定能改善 LLM 推理。与单Agent基线相比,MAD 可以减轻对问答任务中答案准确性的攻击,同时放大问答任务和工作区任务中未经授权的读取或写入。此外,即使五分之三的智能体串通一气,攻击也会将最终答案从正确更改为错误,只有 28.30% 的任务在没有攻击的情况下正确回答,而只有 3.26% 最初正确的诚实智能体在辩论过程中转向错误答案。