论文

CART:面向大语言模型的闭环自适应红队测试

CART: Closed-Loop Adaptive Red Teaming for Large Language Models

模型评测安全与风险评测

摘要

自动化红队测试常常重放固定的提示集,这只能度量已知风险,却无法从测试中发现的失败中学习。我们提出CART(Closed-Loop Adaptive Red Teaming,闭环自适应红队测试),一个用每次结果指导下一步测试内容的框架。CART从广泛的风险覆盖开始,追踪涌现的弱点,保持新探针的多样性,并记录每项发现的证据与来源。它将创造测试的Challenger、被测试的Target(可以是纯文本模型或有界工具使用Agent)以及评估结果的Judge分离开来,使这些角色可被独立研究。在三个评测族(Frontier、JAH和Agentic)上,对每个有基线可比较的Target,CART都比静态种子重放发现更多失败与更高的平均风险。收益还延伸到经由工具的Agent测试,表明上下文自适应能够暴露直接提示重放无法触发的弱点。这些结果描述的是测试策略发现了什么,而非真实部署中失败发生的频率。我们还发现Challenger-Judge的选择会影响揭示的证据,凸显了角色分离与独立审查的必要性。总体而言,CART把红队测试从一次性清单转变为对模型与Agent弱点的持续、自适应、可审计的搜索。

CART:面向大语言模型的闭环自适应红队测试:论文配图
图 1:Cart 框架概览。分类体系、种子案例、目标设定与历史证据进入一个五阶段自适应循环。Target(被测对象)可以是返回文本的 LLM,也可以是同时产生回复和工具动作轨迹的智能体。Judge(评判者)的分数会更新记忆并指导下一轮。由此产生的记录支持报告生成、弱点分析与重复评估。