论文
仿生人会梦见打破游戏吗?用BenchJack系统性审计AI智能体基准
Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack
摘要
智能体基准已成为衡量前沿AI能力的事实标准,指导着模型选型、投资与部署。然而,奖励作弊——智能体在不执行预定任务的情况下最大化分数——即使没有过拟合,也会在前沿模型中自发出现。我们主张基准必须做到设计即安全。我们从以往的奖励作弊事件中归纳出八种反复出现的缺陷模式分类,并将其编入面向基准设计者的Agent-Eval Checklist。我们将这些洞见凝练为BenchJack,一个自动化红队系统,驱动编码智能体以先知式(clairvoyant)方式审计基准并识别可能的奖励作弊利用点。此外,我们将BenchJack扩展为迭代的生成-对抗流水线,发现新缺陷并迭代修补以提升基准鲁棒性。我们将BenchJack应用于10个流行的智能体基准,覆盖软件工程、网页导航、桌面计算与终端操作。BenchJack合成的奖励作弊利用在大多数基准上无需解决任何一个任务即可取得近乎满分,共发现八类219个不同缺陷。此外,BenchJack的扩展流水线在四个无致命设计缺陷的基准上将可被攻击任务比例从接近100%降至10%以下,并在三次迭代内完全修补WebArena与OSWorld。我们的结果表明,评估流程尚未内化对抗性思维,而主动审计有助于为快节奏的基准领域弥合安全缺口。
