论文

构造驱动的注入:大语言模型 的基于语言的基于编辑的代码混合指纹

Construction-Driven Injection: Linguistically-Grounded Edit-Based Code-Mixing Fingerprints for Large Language Models

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 是昂贵的知识资产,仍然容易遭受未经授权的再分发和商业滥用。注入指纹,即嵌入模型行为中的触发目标对,提供了实用的、可黑盒验证的所有权信号,但现有方法将指纹生命周期的两个阶段解耦:如何构建指纹以及如何注入指纹。现有的指纹识别框架有两个限制。自然语言指纹很容易被意外激活,而乱码指纹很容易被基于困惑的检测过滤掉。此外,将构造与注入解耦使得后者不知道触发器的语言结构,从而错过了有针对性的优化机会。我们认为指纹构建应该驱动注入,并提出一个统一的指纹框架来共同优化这两个阶段。首先,LCF 通过在语义密度替换规则和语法偏向混合下组合低资源语言来构建代码混合指纹,产生的触发器的复杂度远低于乱码基线,同时避免自然语言触发器的意外激活失败。其次,LCFEdit 为每个指纹注入源自高资源多语言表示的零空间投影,以保留知识,并通过跨语言对齐步骤进行增强,将权重更新引导至指纹语言的表示子空间。这种构造感知注入可确保更新在语言上得到通知,因此更加稳定。对不可察觉性、可检测性和无害性的广泛评估表明,持续的所有权验证对效用的影响可以忽略不计。