论文

用多Agent评估对角色扮演语言Agent进行对抗压力测试

Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

模型评测安全与风险评测

摘要

角色扮演语言代理(RPLAs)在高压力应用中日益普及,如医疗辅助、客户服务和教育,这些应用要求维持一致的个性、伦理约束和行为一致性,在对抗压力下。现有的评估方法依赖于静态基准或孤立的单回合提示,无法捕捉长时间交互中的累积行为失败。我们提出了一种模块化的多代理平台,通过结构化、多回合对话进行对抗性压力测试。系统协调三个代理:策略驱动的 interrogator 代理应用六级渐进式对抗策略,目标代理代表被评估的 RPLA,并自动评分角色忠实度、偏差、伦理偏离和一致性维度的行为。通过跨三种个性和三种 LLM 家族的实验,我们展示了多策略对抗性测试揭示单策略测试中不可见的失败模式,平均降低整体鲁棒性分数0.17-0.20点。跨模型验证确认了LLaMa-3.3-70B、GPT-4o-mini和Claude-3.5-Haiku在不同攻击方法上的一致降级模式,权威挑战和情绪操纵成为最有效的攻击策略。自动评分达到了强的人类一致性(r = 0.82, Fleiss' κ= 0.71)。这项工作作为开源平台发布,以支持AI安全性和可重复性RPLA基准测试。虽然框架使我们能够系统地发现失败模式,但我们承认对抗性测试方法中的潜在伦理风险,并强调负责任的使用以提高AI安全性。

用多Agent评估对角色扮演语言Agent进行对抗压力测试:论文配图
图1.建议的系统架构。协调员协调询问者代理和目标代理之间基于回合的交互,然后将完整的对话日志传递给判断代理进行自动评估。所有代理共享统一的LLM提供程序抽象层,而FastAPI后端管理实验持久性并将结果公开给React仪表板。