论文
Flower Hub:模拟和部署中联邦学习的可重复基准测试平台
Flower Hub: A Reproducible Benchmarking Platform for Federated Learning in Simulation and Deployment
摘要
联邦学习 (FL) 已成为跨分散数据训练模型的关键方法,但 FL 中的基准测试仍然难以重现、比较和扩展。现有的评估通常与定制基础设施相关,作为不完整的研究代码发布,并且主要在模拟中进行,这限制了可移植性和实际相关性。我们推出 Flower Hub,一个用于发布、发现和执行去中心化和联合应用程序的平台。我们展示了它如何通过将基准测试打包为具有标准化元数据、固定依赖项和显式评估工作流程的可执行版本化应用程序来实现可重复的基准测试。我们通过跨领域和跨设备设置的多域基准测试套件实例化了这种方法,包括医学成像、金融表格学习、法律指令调整、网络钓鱼 URL 检测和音频标记等任务。我们进一步证明,相同的基准测试应用程序可以在模拟和部署运行时运行,而无需更改应用程序代码,从而能够跨不同的学习环境进行统一评估。除了模型质量之外,我们的基准测试设计还支持系统感知报告,包括运行时和通信指标。这项工作将 FL 设置中的基准测试从临时代码工件推进到可移植、可执行和可重用的基准测试应用程序。