论文
Claudini:Autoresearch 发现 LLM 最先进的对抗攻击算法
Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs
摘要
我们证明人工智能代理能够发现针对 LLM 的对抗性攻击的新颖算法,从而推进白盒越狱和即时注入评估的最新技术。我们在自动研究循环中部署前沿代理,例如 Claude Code 和 Codex,可以访问包含 30 多种先前方法的库以及具有固定计算预算的评估脚本。我们证明了该管道在越狱 OpenAI 的 GPT-OSS-Safeguard-20B 和针对 Meta-SecAlign-70B(一种对抗性稳健模型)的快速注入方面非常有效。对于 GPT-OSS-Safeguard,最佳代理发现方法可在 CBRN 查询上实现高达 80% 的攻击成功率,而现有方法的攻击成功率则低于 50%。对于 SecAlign,它实现了 100% ASR,而之前最好的自动化方法仅实现了 82%。值得注意的是,在我们的设置中,攻击方法是在不相关的代理模型上开发的,用于纯粹的随机目标词元强制任务,但可以直接推广到对对抗训练模型进行提示注入。最后,我们追溯了自动研究过程中开发的方法的沿袭,描述了代理的策略和失败模式。对抗性机器学习长期以来一直认为,必须针对针对其量身定制的攻击来评估防御措施;自动研究使这一原则自动化,我们认为它应该成为未来防御评估的最低标准。