论文

跨大量智能体轨迹的安全违规检测

Detecting Safety Violations Across Many Agent Traces

模型评测安全与风险评测

摘要

为了识别安全违规,审计人员常常需要在庞大的智能体轨迹集合中进行搜索。这种搜索十分困难,因为故障往往罕见、复杂,有时甚至被对抗性地隐藏,只有同时分析多条轨迹才能发现。这些挑战出现在多种场景中,如滥用活动、隐蔽破坏、奖励劫持(reward hacking)与提示注入。现有方法在此类场景中面临困难,原因有几点:逐轨迹判别器会漏掉只有跨轨迹才能显现的故障;朴素的智能体审计无法扩展到大规模轨迹集合;固定监视器对未预料到的行为十分脆弱。我们提出Meerkat,它将聚类与智能体搜索相结合,以发现以自然语言描述的违规。通过结构化搜索以及对有希望区域的自适应调查,Meerkat无需依赖种子场景、固定工作流或穷举枚举即可发现稀疏故障。在滥用、目标错位与任务作弊设定中,Meerkat对安全违规的检测显著优于基线监视器,在一个顶级智能体基准上发现了大范围的开发者作弊,并在CyBench上找到接近以往审计4倍的奖励劫持样例。