论文
审计域适应的 LLM 中的训练数据:LoRA-MINT
Auditing Training Data in Domain-adapted LLMs: LoRA-MINT
摘要
我们提出了 LoRA-MINT,这是一种应用于最近的 大语言模型 (LLM) 的成员推理测试 (MINT) 新方法,通过低秩适应 (LoRA) 针对特定自然语言处理 (NLP) 任务进行了微调。主要目标是评估单个样本是否是这些改编模型的训练数据的一部分,为知识产权和敏感数据的管理提供有用的审计工具。我们的分析探讨了模型困惑度与会员状态之间的关系,为估计微调 LLM 中的数据暴露提供了一个系统框架。我们对四个模型和三个基准数据集进行了实验,获得了确定给定数据是否用于训练的精度值,范围为 0.77 到 0.92,其性能优于最先进的基线,并证明了所提出方法的鲁棒性和通用性。总的来说,我们的研究结果强调了 LoRA-MINT 作为有效且可扩展的框架的潜力,用于审计 LLM、提高透明度以及促进 AI 和 NLP 技术的道德和负责任的部署。为了具体性和当前的相关性,我们的讨论和实验集中在 LoRA 调整的 LLM 上,但请注意,考虑到任何其他适应 LLM 的技术,或者更一般地说,任何其他领域适应的 AI 模型,所提出的大多数方法都可以轻松适用于审核训练数据。