论文

通过内在分布指纹审计LLM微调的数据来源

Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints

模型评测评测方法与指标

摘要

大规模语言模型(LLMs)的泛滥引发了未经授权的细调数据知识产权(Data IP)侵权的风险。现有的审计技术在数据准备或训练期间需要干预,并且在恶意篡改如数据重述和知识蒸馏的情况下仍然脆弱。我们提出了一种基于黑盒和恶意设置下的审计框架——分布证明审计(DPA)。DPA基于一个关键洞察:无论细调策略如何逃避来源,模型的实际用途仍然要求模型保留语义内容和词汇形式的交集。因此,DPA将这种持续的词汇-语义交集作为内在分布指纹。该框架将审计视为统计假设检验,通过无偏输出抽样有效地量化这些指纹,以可靠地拒绝非使用假设。在医疗和法律领域进行广泛的实验结果表明,DPA在现有基准中持续表现出色,且在使用重述和知识蒸馏的恶意训练器时仍然稳健。我们进一步强调了一个基本的双重用途张力:相同的高质量分布指纹可以可靠地进行审计,但同时也可以用于隐私攻击。

通过内在分布指纹审计LLM微调的数据来源:论文配图
图 1. 分销来源审计 (DPA) 示意图。