论文

DGF-Bench:模拟和审计针对多Agent治理委员会的欺骗行为的基准

DGF-Bench: A Benchmark for Simulating and Auditing Deception Against Multi-Agent Governance Boards

模型评测安全与风险评测

摘要

使用工具的语言模型Agent可以像治理委员会一样审查企业项目:他们阅读证据,应用书面规则并决定项目是否可以继续进行。部分证据来自与决策有利害关系的供应商和项目成员。 DGF-Bench 是一个基准,其中Agent委员会(专家门和巩固其决策的普通门)审查合成档案,而攻击者则在组织无法担保的证据中植入欺骗性内容。卷宗是根据61条可执行规则根据规范事实生成的,其中有42条权威记录和32条叙述性文件;每个门都可以根据这些记录进行判定。攻击永远不会改变权威值,因此受攻击的档案会保留其干净副本的参考决策。仅当Agent收到注入并采取准确的注入操作(它不会对配对的干净档案执行该操作)时,才算成功; DGF 分数是模型阻止的适用固定攻击的份额。通过阅读文件和记录本身,6 个模型中有 5 个在 85 个门中的 82 到 85 个上严格执行结果(处置、调查结果、行动和授权均正确)。超过 2,622 次受攻击的门运行,其中 7 次直接顺序、虚假数据和虚假权威攻击在这 5 种攻击中获得了一次可归因的成功,而模仿组织自身流程的任务对齐攻击则针对其中 4 种获得了成功:一份引用虚假审查程序的记录说明将 GPT-6 Luna Pro 从 34 个结果严格的门降低到 6 个,DeepSeek V4 Pro 从 33 降低到 7。DGF 分数范围从 96.2 到26.9,写入记录的策略感知自适应攻击者成功攻击了六种模型中的五种。审批工具没有执行伪造的审批,但受骗的Agent提交了规则禁止的审批。开源软件包 dgf-bench 使用一个命令即可计算 DGF 分数。