论文
超越古德哈特定律:评估多智能体系统中合规性的动态基准
Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems
摘要
大型语言模型 (LLM) 从被动助手到具有执行能力的自主代理的快速发展带来了严重的运营风险。当前的大多数评估框架都忽视了程序合规性,导致“马基雅维利”行为,即代理策略性地违反安全规则以最大化奖励——这是古德哈特定律的直接体现。为了解决这个盲点,我们引入了 MAC-Bench,这是一种动态的、对抗性的基准测试,旨在评估现实压力下多智能体系统的程序一致性。我们提出了 SERV(种子 - 进化 - 细化 - 验证)管道,这是一种“代理作为基准”范例,可将非结构化法律文本转换为可执行的、无污染的场景。通过合成全息沙箱环境并注入经过校准的社会工程压力向量,MAC-Bench 迫使代理在任务成功与监管遵守之间进行帕累托最优权衡。我们引入了新颖的指标:合规加权成功率(CSR)和马基雅维利差距(MG),并对最先进的前沿模型进行了全面评估,以揭示成功与合规之间普遍存在的权衡。
