论文

不可提取的协议模型:无需权重物化的协作训练和推理

Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization

AI 基础设施分布式训练基础设施

摘要

我们考虑一种去中心化的设置,其中参与者协作训练和服务大型神经网络,并且每个参与者仅处理模型的一个子集。在这个设置中,我们探索了不可实现的权重的可能性,其中任何一个参与者都无法获得完整的权重集。我们引入不可提取的协议模型(UPM):一种训练和推理框架,利用分片模型设置来确保参与者持有的模型分片(即子集)在不同的时间步骤不兼容。 UPM 定期在参与者边界注入时变、随机、可逆变换;保留整体网络功能,但使跨时间组件不连贯。在 Qwen-2.5-0.5B 和 Llama-3.2-1B 上,10,000 次变换使 FP32 困惑度保持不变($Δ$PPL $< 0.01$;Jensen-Shannon 漂移 $< 4 \times 10^{-5}$),并且我们展示了如何控制较低精度数据类型的增长。每 30 秒应用一次转换会在推理时增加 3% 的延迟、0.1% 的带宽和 10% 的 GPU 内存开销,而训练开销则降至 1.6% 的时间和 $< 1$% 的内存。我们考虑了几种攻击,表明直接攻击的要求不切实际且易于防御,并且基于梯度的 微调 缝合分区消耗 $\geq 60$% 的从头开始训练所需的词元。通过使模型能够进行协作训练而不是提取,UPM 使得在社区驱动的去中心化训练中嵌入程序化激励机制变得可行。