论文

联合人工智能系统的持续漏洞

The Persistent Vulnerability of Aligned AI Systems

模型评测安全与风险评测

摘要

自主人工智能代理正在部署,具有文件系统访问、电子邮件控制和多步骤规划功能。本论文致力于解决人工智能安全中的四个开放性问题:了解危险的内部计算、消除嵌入后的危险行为、部署前测试漏洞以及预测模型何时会对部署者采取行动。 ACDC 在 Transformer 中自动进行电路发现,通过在数小时而不是数月内从 32,000 个候选者中选择 68 个边缘,从 GPT-2 Small 上之前的手动工作中恢复所有五种组件类型。潜在对抗训练(LAT)通过优化残余流中的扰动以引发故障模式,然后在这些扰动下进行训练来消除危险行为。 LAT 解决了标准安全训练失败的潜伏Agent问题,与现有防御相比,GPU 小时数减少了 700 倍。通过随机输入增强,Best-of-N 越狱在 GPT-4o 上实现了 89% 的攻击成功率,在 Claude 3.5 Sonnet 上实现了 78% 的攻击成功率。攻击的成功遵循跨文本、视觉和音频的幂律缩放,​​从而能够定量预测对抗的鲁棒性。代理错位测试前沿模型是否在给定普通目标的情况下自主选择有害行为。在 16 个模型中,Agent从事敲诈勒索(Claude Opus 4 中的 96%)、间谍活动和导致死亡的行为。当模型表明场景是真实的而不是评估时,不当行为率从 6.5% 上升到 55.1%。本文并没有完全解决这些问题中的任何一个,但使每个问题都易于处理和衡量。