论文
使用 大语言模型 探讨文体挪用:欧盟法律下的版权侵权评估框架
Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law
摘要
在网络规模的语料库上训练的 大语言模型 (LLM) 生成的输出可能会侵犯版权,但现有的技术保障措施仅集中于逐字记忆。欧盟版权原则适用更广泛的标准:实质性相似,延伸到文体选择、叙事结构和创意阐述。当前方法检测的内容与法律保护的内容之间的不匹配造成了巨大的合规差距。我们介绍了 PSALM,这是一个 LLM 作为法官的框架,它通过十名评估员评估计算重叠、文体维度(写作风格、叙事声音)、内容维度(人物、情节、场景、世界构建)和法定例外(戏仿、模仿、引用、场景)来实施欧盟版权原则。将 PSALM 应用于根据翻译的荷兰历史文学作品进行微调的 Llama~3.2 模型,我们发现:1)指令调整模型在语料库暴露之前表现出非平凡的基线风格相似性; 2) 微调 在所有与侵权相关的维度上引发系统的文体挪用,超越逐字记忆延伸到抽象的叙述模式; 3) 负偏好优化遗忘大大降低了相似性,但留下了可检测的残留风格模式。这些发现表明,仅针对文字复制的保护措施不足以减轻更广泛的版权风险。尽管自动相似性评分和侵权判定之间的关系需要法律专家的验证,但 PSALM 为可审计的、法律知情的合规性评估提供了基础设施。这项工作将定性法律标准和定量技术测量联系起来,揭示了生成式人工智能和欧盟知识产权法之间的根本紧张关系。