论文

用于语言模型嵌入的私人联合持续学习的规范化稳定列表重放

Canonicalized Stable-List Replay for Private Federated Continual Learning over Language-Model Embeddings

模型训练持续学习

摘要

联合持续学习 (FCL) 允许分布式客户端调整语言模型头以适应不断发展的 NLP 任务,而无需共享原始文本。在用户级差分隐私(DP)下,基于重放的持续学习面临结构性障碍:客户端只能发布候选重放摘要的小噪声列表,并且这些列表在客户端之间是无序的。我们引入了规范化稳定列表重放(CSLR),其中客户端在共享句子嵌入空间上私下生成候选重放分布,并且服务器使用公共锚句子引起的签名来对齐它们。锚点为聚合提供可识别性,而不是额外的重放数据。我们证明,在可观察的锚签名边际下, $O(\log(N/η)/p)$ 锚以至少 $1-η$ 的概率区分 $N$ 候选列表元素,并且我们给出了无序标签预言机模型的范围无锚不可识别性结果。在连续分类、NER 和对话基准的五个种子中,CSLR 在报告的重放发布预算下 $\eps=4$ 下将最终平均任务指标比最强的非 CSLR DP 基线提高了 3.9--5.6 点,同时也优于匈牙利和最佳传输匹配器。正式的隐私保证涵盖重播发布;端到端私人训练还需要与私人优化器组合以进行任务头更新。