论文
CART:面向大语言模型的闭环自适应红队测试
CART: Closed-Loop Adaptive Red Teaming for Large Language Models
摘要
自动化红队测试常常重放固定的提示集,这只能度量已知风险,却无法从测试中发现的失败中学习。我们提出CART(Closed-Loop Adaptive Red Teaming,闭环自适应红队测试),一个用每次结果指导下一步测试内容的框架。CART从广泛的风险覆盖开始,追踪涌现的弱点,保持新探针的多样性,并记录每项发现的证据与来源。它将创造测试的Challenger、被测试的Target(可以是纯文本模型或有界工具使用Agent)以及评估结果的Judge分离开来,使这些角色可被独立研究。在三个评测族(Frontier、JAH和Agentic)上,对每个有基线可比较的Target,CART都比静态种子重放发现更多失败与更高的平均风险。收益还延伸到经由工具的Agent测试,表明上下文自适应能够暴露直接提示重放无法触发的弱点。这些结果描述的是测试策略发现了什么,而非真实部署中失败发生的频率。我们还发现Challenger-Judge的选择会影响揭示的证据,凸显了角色分离与独立审查的必要性。总体而言,CART把红队测试从一次性清单转变为对模型与Agent弱点的持续、自适应、可审计的搜索。
