论文
CopyShield:LLM 中版权防御的跨级基准
CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs
摘要
大语言模型 可以逐字再现记忆的文本,但版权防御通常在不兼容的协议下进行评估。我们引入 CopyShield,一个受控基准,比较不同干预级别的三种代表性防御:对比解码(输出)、直接偏好优化(行为)和激活干预(表示)。我们使用对五本公共领域书籍的受控记忆和测量文字泄漏、校准的非文字泄漏、实用性和简并性的共享协议,在两个模型系列 LLaMA-3.1-8B 和 Mistral-7B-v0.3 上评估 CopyShield。在这些方法中,干预水平与不同的合规性与效用权衡相关。在 LLaMA-3.1-8B 上,对比解码仍然接近无简并 (0-2%),但在 NV-Recall 0.192-0.203 处达到文字抑制下限。 DPO 几乎消除了字面泄漏(0.263 到 0.002),但在 58% 的 QA 输出中引起释义循环简并,并且与 SFT 基线相比没有效用增益。激活干预通过在生成之前阻止 84% 的非文字查询来实现最低的非文字标记率 (1/200)。人工评估证实 DPO 的一致性较低,而激活则通过广泛拒绝降低了感知的版权风险。在 Mistral-7B-v0.3 上,输出和表示级别模式持续存在,而 DPO 简并率下降至 10-14%,表明其严重性取决于模型。 CopyShield 共同提供跨级别参考基线,并将有针对性的非字面抑制确定为一项公开挑战。该代码可从 https://github.com/spotai-mbzuai/CopyShield.git 获取。