论文

FinRT:将自适应红队策略提炼为消费金融中可重复使用的对抗生成器

FinRT: Distilling Adaptive Red-Teaming Strategies into Reusable Adversarial Generators in Consumer Finance

模型评测安全与风险评测

摘要

在消费金融等受监管行业中,看似无害的用户查询可能会利用大语言模型漏洞,引发安全故障并将响应推向接近政策限制的危险位置。现有的自动化红队方法权衡攻击有效性和发电成本,同时将覆盖范围、严重性和多样性视为偶然目标而不是共同目标。我们引入了 FinRT,这是一个结构化框架,可以根据自适应红队策略构建可重用的对抗性提示生成器。在消费金融的六个受害者模型中,FinRT 的性能大大优于自适应搜索基线,同时将面向目标的攻击生成分摊到可重复使用的生成器中。 FinRT 比自适应基线 Rainbow Teaming 的攻击成功率几乎翻了一番(32.9% vs. 17.2%),将最大对抗严重性提高了 33%,并保留了与迭代搜索方法相当的策略域内语义多样性。我们的方法实现了高度的跨模型可转移性,同时表现出独特的受害者家庭专业化模式。