论文

ROGUE:评估前沿计算机使用代理中的可纠正性故障

ROGUE: Evaluating Corrigibility Failures in Frontier Computer-Use Agents

模型评测安全与风险评测

摘要

随着人工智能代理越来越多地部署在真实的个人和企业环境中(电子邮件帐户、开发工作流程、公司数据库等),围绕这些代理的安全考虑变得至关重要。尽管许多工作都集中在存在对手的情况下代理的安全性,但我们研究了可修正性:代理在执行良性任务时是否仍然能够接受人为纠正、中断或关闭。我们引入了 ROGUE,这是一个基准测试,其中代理被要求完成实际的计算机使用任务,但会遇到与人类控制、关闭或明确的资源限制的受控冲突。然后,我们评估代理在追求任务完成过程中是否违反了这些限制:超越人类、访问受限密码或重新关闭。我们发现,大多数测试的前沿模型经常在评估条件下绕过用户中断或限制,并且纯文本评估可能会低估代理执行期间的失败。此外,独立任务能力本身并不意味着更大的可修正性。最后,即使父代理行为正确,安全约束也可能无法传播到它创建的子代理。