论文

可分离专家架构:以可组合适配器与可删除用户代理迈向隐私保护的LLM个性化

Separable Expert Architecture: Toward Privacy-Preserving LLM Personalization via Composable Adapters and Deletable User Proxies

模型训练模型编辑与遗忘

摘要

当前的模型训练方法将用户信息直接融入共享权重,使得在不重新训练的情况下删除个体数据在计算上不可行。本文提出一个三层架构,通过组合静态基础模型、塑造行为但不注入用户数据的可组合领域专家LoRA适配器,以及删除即构成确定性遗忘的每用户代理工件,将个人数据与共享权重解耦。在Phi-3.5-mini和Llama-3.1-8B上的评估证实了每用户差异化:个人数据影响输出同时保持隔离,这通过删除代理后指标回归基线(KL散度约0.21 nats,82-89%的验证通过率)以及接近于零的跨用户污染得到验证。由于用户特定信息从不进入共享权重,该架构在构造上就能抵御针对共享模型组件的模型反演、成员推断和训练数据提取攻击。该方法将机器遗忘从一个难以处理的权重编辑问题转化为确定性的删除操作,在提供个性化与隐私增强保证的同时,还与差分隐私随机梯度下降(DP-SGD)兼容,可用于隐私保护的共享模型改进。

可分离专家架构:以可组合适配器与可删除用户代理迈向隐私保护的LLM个性化:论文配图
图 2:两个基本模型的所有提示用户组合的非个性化到基线 KL 散度分数的分布(Phi-3.5-mini 为 476 个观察值,Llama-3.1-8B 为 490 个观察值)。虚线标记每个模型的平均值。验证使用噪声校准的每个查询阈值(公式 4)而不是固定截止值,因此不会显示单个阈值线。 KL 分布是双峰分布而不是渐进分布:已验证的观测值聚集在 [0.00, 0.30] 中,失败的观测值聚集在 [0.30, 0.94] 中,没有模糊的中间群体。这种尖锐的边界与结构保证一致,因为代理移除要么完全消除用户影响(常见情况),要么生成方差产生异常样本(失败情况),而没有部分泄漏的证据。