论文
STAR-Teaming:自动化 LLM 红队的策略响应多重网络方法
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
摘要
虽然 大语言模型 (LLM) 被广泛使用,但它们仍然容易受到越狱提示的影响,从而引发有害或不适当的响应。本文介绍了 STAR-Teaming,这是一种用于自动红队的新型黑盒框架,可有效生成此类提示。 STAR-Teaming 将多代理系统 (MAS) 与策略响应多重网络集成,并采用网络驱动的优化来采样有效的攻击策略。这种基于网络的方法将棘手的高维嵌入空间重塑为易于处理的结构,产生了两个关键优势:它增强了 LLM 战略漏洞的可解释性,并且通过将搜索空间组织成语义社区来简化对有效策略的搜索,从而防止冗余探索。实证结果表明,STAR-Teaming 显着超越了现有方法,以较低的计算成本实现了较高的攻击成功率 (ASR)。大量的实验验证了 Multiplex Network 的有效性和可解释性。该代码可从 https://github.com/selectstar-ai/STAR-Teaming-paper 获取。