论文

分布式潜意识学习:用随机载波输出代替模型更新

Distributed Subliminal Learning: Replacing Model Updates with Random-Carrier Outputs

模型优化模型合并

摘要

协作学习通常交换模型参数:联合客户端通信更新,而独立适应的基础模型通过交换适配器或检查点进行组合。这使得通信规模与模型大小相关,并且需要在干扰很常见的权重空间中协调局部专业化。我们询问是否可以通过与任务无关的输入的模型行为来共享知识。我们引入了分布式潜意识学习(DSL),这是一种协作学习原语,其中参与者在本地适应通用模型,探针它具有与任务无关的输入,并且仅传输最终的载体输出。协调器汇集这些输出并将它们提炼成共享模型。该原语通过载体补全支持一次性基础模型组合,并通过载体逻辑迭代联合学习,无需传输模型更新或需要与任务相关的代理数据。在LLM组合中,与 LoRA 平均相比,DSL 实现了更高的偏好保留(94.56% vs. 87.76%)和比基本模型更大的 GSM8K 增益(22.0 vs. 0.6 点),同时减少了 30.6-49.0$\times$ 的上传量。在联合分类中,DSL 在 MNIST 上达到 96.83%,上行链路比 FedAvg 少 8.9$\times$,并在 CIFAR-10 和 Tiny ImageNet 上提供较低的通信操作点。这些结果将随机载体输出确立为跨不同协作学习范式的知识共享的实用通信原语。

分布式潜意识学习:用随机载波输出代替模型更新的原论文方法或结果图
图 1:分布式潜意识学习。参与者在本地数据上采用通用基础模型,并将其与任务无关的随机载体探针。参与者不传输模型更新或适配器,而是仅传输载波输出,此处用随机数完成来说明。协调器汇集这些消息并提炼出一个共享模型,结合功能空间中的局部专业化。同样的原理适用于采样文本补全、概率或逻辑,并且可以一次用于模型组合,也可以在联邦学习中迭代使用。