论文
可分离专家架构:以可组合适配器与可删除用户代理迈向隐私保护的LLM个性化
Separable Expert Architecture: Toward Privacy-Preserving LLM Personalization via Composable Adapters and Deletable User Proxies
摘要
当前的模型训练方法将用户信息直接融入共享权重,使得在不重新训练的情况下删除个体数据在计算上不可行。本文提出一个三层架构,通过组合静态基础模型、塑造行为但不注入用户数据的可组合领域专家LoRA适配器,以及删除即构成确定性遗忘的每用户代理工件,将个人数据与共享权重解耦。在Phi-3.5-mini和Llama-3.1-8B上的评估证实了每用户差异化:个人数据影响输出同时保持隔离,这通过删除代理后指标回归基线(KL散度约0.21 nats,82-89%的验证通过率)以及接近于零的跨用户污染得到验证。由于用户特定信息从不进入共享权重,该架构在构造上就能抵御针对共享模型组件的模型反演、成员推断和训练数据提取攻击。该方法将机器遗忘从一个难以处理的权重编辑问题转化为确定性的删除操作,在提供个性化与隐私增强保证的同时,还与差分隐私随机梯度下降(DP-SGD)兼容,可用于隐私保护的共享模型改进。
