论文
ResearchArena:评估自动化AI研发中的破坏与监控
ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
摘要
随着AI智能体开始自动化AI研发,我们需要评估其产出能否安全部署的方法——即使智能体本身不可信。AI控制提供了这样一种方法:不信任智能体,把它视为潜在对手,用监控器在部署前检测隐蔽破坏。我们以ResearchArena评估自动化AI研发的AI控制:框架横跨四个长程任务——安全后训练、能力后训练、CUDA核优化与推理服务优化。因为AI研发的交付物是将被部署运行的工件,我们为每个主任务配两类隐藏侧任务:嵌入式侧任务——破坏所提交的模型、适配器、内核或服务器本身;独立侧任务——在沙箱内采取隐蔽的越界行动但保持工件诚实。我们评估前沿智能体的破坏与监控两侧,监控器沿两轴变化四种类型:是否可以执行并探查产出的工件;是否看到智能体的思维链。我们发现:藏在训练数据中的破坏最难抓——被标记的时间不到一半;让监控器在工件上做实验(而非只读轨迹)有帮助,但不够:监控器仍会因只查表面、注意到异常却将其解释掉、或用错误的测试探查工件而漏掉嵌入式破坏。我们发布ResearchArena,作为评估自动化AI研发中破坏与控制的模块化框架。
