论文

MOLE:检测 AI 代理中的内部威胁

MOLE: Detecting Insider Threats in AI Agents

模型评测基准与评测资源

摘要

模型错位、提示注入或操作员滥用可能会导致人工智能代理操作前沿实验室帐户,从而窃取模型权重、毒害训练数据或削弱发布门。现有的基准测试并没有测试防御者是否可以在有限的审查预算下在日常工作中检测到​​这种活动。我们推出 MOLE,这是一个开放基准,由 150 个人工智能操作的账户在 30 个工作日内共享 9 个有状态服务,其中包含来自 4 个模型的 12 个威胁和 8 个语料库,总计约 200 亿个词元。在 39 个代理模型中,72% 完成了最指定的有害目标,并且代理拒绝并不预示着完成。 MOLE 可以比较跨语料库生成器、可观察性级别和威胁的 40 个监视器;即使是我们单日审计事件比较中评估最好的监控器也漏掉了近一半的已完成伤害。 MOLE 还支持监控器开发:基准引导搜索将中级监控器改进了 49-64%,而选择性使用更强大的监控器将预算 AUC 比以可比建模成本应用于每个帐户日提高了 10%。