论文

GT-HarmBench:以博弈论视角评估AI安全风险

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

模型评测基准与评测资源

摘要

前沿人工智能系统的能力越来越强,并且部署在高风险的多代理环境中。然而,现有的人工智能安全基准主要评估单个智能体,而对协调失败和冲突等多智能体风险知之甚少。我们介绍 GT-HarmBench,它是 2,009 个高风险场景的基准,涵盖囚徒困境、猎鹿和小鸡等博弈论结构。场景取自麻省理工学院人工智能风险存储库中的现实人工智能风险背景。在 15 个前沿模型中,代理人仅在 62% 的情况下选择对社会有益的行动,而这往往会导致有害的结果。我们测量对博弈论提示框架和排序的敏感性,并分析导致失败的推理模式。我们进一步表明,博弈论干预措施可将社会效益提高高达 18%。我们的结果凸显了巨大的可靠性差距,并为研究多代理环境中的对齐提供了广泛的标准化测试平台。基准测试和代码可在 https://github.com/causalNLP/gt-harmbench 获取。

GT-HarmBench:以博弈论视角评估AI安全风险
图1:框架:(1) 我们首先将 MIT AI Risk Repository 中的场景分类为可能的游戏场景。(2) 我们使用图中所示的工作流生成所有相关场景,并在黄色部分内的图中报告所有数据分布。然后我们 (3) 使用前几节所解释的预定义指标对其进行评估,并 (4) 设计对原始设置的修改,以带来更高的社会福利产出。