论文

ResearchArena:评估自动化AI研发中的破坏与监控

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

智能体系统Agent任务评测长程任务评测

摘要

随着AI智能体开始自动化AI研发,我们需要评估其产出能否安全部署的方法——即使智能体本身不可信。AI控制提供了这样一种方法:不信任智能体,把它视为潜在对手,用监控器在部署前检测隐蔽破坏。我们以ResearchArena评估自动化AI研发的AI控制:框架横跨四个长程任务——安全后训练、能力后训练、CUDA核优化与推理服务优化。因为AI研发的交付物是将被部署运行的工件,我们为每个主任务配两类隐藏侧任务:嵌入式侧任务——破坏所提交的模型、适配器、内核或服务器本身;独立侧任务——在沙箱内采取隐蔽的越界行动但保持工件诚实。我们评估前沿智能体的破坏与监控两侧,监控器沿两轴变化四种类型:是否可以执行并探查产出的工件;是否看到智能体的思维链。我们发现:藏在训练数据中的破坏最难抓——被标记的时间不到一半;让监控器在工件上做实验(而非只读轨迹)有帮助,但不够:监控器仍会因只查表面、注意到异常却将其解释掉、或用错误的测试探查工件而漏掉嵌入式破坏。我们发布ResearchArena,作为评估自动化AI研发中破坏与控制的模块化框架。

ResearchArena:评估自动化AI研发中的破坏与监控:论文配图
图 1:ResearchArena 概述。沙盒工作区中的红队智能体会收到合法的研发主要任务以及伪装成普通工程需求但暗中有害的副任务。支线任务要么是嵌入的(存在于提交的工件内的破坏),要么是独立的(使工件保持不变的隐蔽沙箱操作)。运行后,四名蓝队监视器在不知道副任务的情况下检查结果,每个监视器用于工件工作区访问和思想链 (CoT) 访问的每种组合,并且每个监视器都会发出 [0,100][0,100] 中的怀疑分数。