论文
用GFlowNets为LLM生成攻击
Generating Attacks for LLMs with GFlowNets
摘要
大语言模型(LLM)的快速发展促使其被广泛集成到各个领域,得到普遍采用。然而这一不断升级的趋势带来了显著的安全漏洞,需要识别并缓解恶意利用引发的缺陷。通过多样化对抗输入评估模型鲁棒性的红队评估,对于暴露安全风险和实施对策至关重要。目前红队测试要么由专家手工执行,要么使用预定义攻击数据集自动进行。然而手工测试仍然耗时,而现有自动方法由于固有地依赖固定数据集,创造力有限。在本研究中,我们提出一种自动化、无需人工且自适应的方法,利用GFlowNets通过一个大语言模型测试另一个来发现LLM漏洞。在该框架中,针对指定的受害模型训练攻击者模型,以执行自动化红队测试并给出定量的鲁棒性评分。本研究旨在生成比现有基准更有效的英文对抗攻击,并作为对文献的新贡献,引入一个能够生成土耳其语攻击输入的模型。
