论文

通过有针对性的重写伪造大语言模型作者指纹

Forging LLM Authorship Fingerprints with Targeted Rewriting

模型评测安全与风险评测

摘要

模型归因分类器通常可以识别哪个语言模型生成了文本,从而使特定于模型的书写模式成为出处的信号。然而,对未修改文本的准确归属并不能表明预测在故意重写后是否仍然可以识别原始来源。我们将这个问题表述为有针对性的指纹转移:重写一个模型的输出,以便归因分类器将其分配给选定的目标模型。我们研究摘要,其中不同的模型接收相同的文档并表达相同的底层内容,为条件生成提供受控设置。我们引入了 ForgePrint,这是一种搜索然后提取的框架,它首先搜索将归因移向目标指纹的重写,然后将所选重写提取到一次性 4B 学生模型中。在 CNN/DM 上,与从未受到攻击查询的保留分类器相比,学生达到了 70.2% 的目标成功率,优于其教师 (54.1%) 和六个已发布的重写基线中最强的一个 (39.3%)。当将摘要从开放模型转移到选定的商业模型时,它也达到了 68.3% 的目标成功率。这些结果表明,指纹可检测性不应与源真实性混为一谈,并且纯文本归因可能会在有针对性的重写下提供模型身份的误导性证据,即使它在未修改的文本上是准确的。