论文

TextCloak:通过 RL 驱动的不可学习文本阻止未经授权的 LLM 利用

TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text

模型训练强化学习

摘要

大语言模型 (LLM) 的快速发展带来了广泛的语言任务的显着进步,同时也引发了人们对未经授权的数据利用和隐私泄露的日益担忧。不可学习的例子(UE)通过在数据中引入精心设计的扰动来提供有希望的防御,从而使在它们上训练的模型表现出效用下降。然而,现有的文本保护方法主要是为判别性语言模型中的分类任务(例如情感分析)而设计的,并且通常依赖于注入特定于类的语言线索,这限制了它们在 LLM 的开放式生成设置中的有效性。在这项工作中,我们提出了 TextCloak,这是一种 RL 驱动的框架,用于保护文本数据免受未经授权的 LLM 攻击。 TextCloak 采用生成策略,将批量干净文本转换为无法学习的示例,同时保留语义保真度和语言自然性。为了优化策略,我们引入了 GRPO-UE,它根据在微调代理 LLM 中引起的下游退化来奖励生成的不可学习文本,并通过组相关策略优化更新生成器参数。这种双层优化使生成器能够发现超出类别特定线索的通用保护模式。对六个公开可用的数据集和九个最先进的 LLM 的综合实验表明,TextCloak 始终如一地损害未经授权的 微调,同时保持合法使用的文本实用性。进一步的分析确定了其跨模型架构、训练配置和自适应攻击的可转移性和鲁棒性,强调了其作为针对未经授权的 LLM 攻击的实际防御的广泛适用性。