论文

模糊任务的扩散人工智能控制

Diffuse AI Control on Fuzzy Tasks

模型评测安全与风险评测

摘要

部署在人工智能安全研究等关键领域的人工智能模型可能会因不一致而巧妙地破坏我们的努力。扩散人工智能控制是人工智能安全的一个子领域,涉及减轻长期部署范围内分布的人工智能破坏风险(扩散威胁)。这些风险对于模糊任务(即难以评分或需要直觉的任务)尤其有害。为了理解模糊任务上的分散威胁,我们引入了一个框架,该框架将人工智能控制视为蓝队和红队之间的对抗游戏。蓝色团队使用弱可信模型来构建弱分数,根据该分数,他们将训练一个强大的、潜在颠覆性的模型,以消除颠覆倾向(如果存在)。然后,红队尝试找到由弱分数评价较高的模型行为,因此可能不会被训练出来,但实际上对应于较差的表现。我们测试了我们的框架,即为最近的 ML 论文中的研究问题编写实验提案。我们使用可以访问原始论文的语言模型作为代理“真值”评分器。我们的红色团队使用多目标进化提示优化来发现颠覆性行为。我们表明,根据 真值 代理,Opus~4.6 可以编写比 GPT-OSS-20B 更差的提案,而弱评分者对它们的评分与 Opus 4.6 中的最佳提案一样高。然后,我们为蓝队提出一种对抗性优化算法,为弱模型发现更稳健的提示。该算法会产生蓝队提示,而我们的红队优化无法利用该提示。