论文
GT-HarmBench:以博弈论视角评估AI安全风险
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
摘要
前沿人工智能系统的能力越来越强,并且部署在高风险的多代理环境中。然而,现有的人工智能安全基准主要评估单个智能体,而对协调失败和冲突等多智能体风险知之甚少。我们介绍 GT-HarmBench,它是 2,009 个高风险场景的基准,涵盖囚徒困境、猎鹿和小鸡等博弈论结构。场景取自麻省理工学院人工智能风险存储库中的现实人工智能风险背景。在 15 个前沿模型中,代理人仅在 62% 的情况下选择对社会有益的行动,而这往往会导致有害的结果。我们测量对博弈论提示框架和排序的敏感性,并分析导致失败的推理模式。我们进一步表明,博弈论干预措施可将社会效益提高高达 18%。我们的结果凸显了巨大的可靠性差距,并为研究多代理环境中的对齐提供了广泛的标准化测试平台。基准测试和代码可在 https://github.com/causalNLP/gt-harmbench 获取。
