论文

FedGUI:跨异构平台、设备和操作系统对联合 GUI智能体 进行基准测试

FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating Systems

智能体系统Agent任务评测

摘要

使用传统的集中式方法训练 GUI智能体 面临着巨大的成本和可扩展性挑战。联邦学习(FL)提供了一种很有前途的解决方案,但由于缺乏捕捉现实世界、跨平台异构性的基准,其潜力受到阻碍。为了弥补这一差距,我们引入了 FedGUI,这是第一个用于跨移动、Web 和桌面平台开发和评估联合 GUI智能体 的综合基准。 FedGUI 提供了一套由六个精选数据集组成的套件,用于系统地研究四种关键类型的异构性:跨平台、跨设备、跨操作系统和跨源。大量的实验揭示了几个关键的见解:首先,我们证明跨平台协作可以提高性能,将之前的仅限移动设备的联合学习扩展到不同的 GUI 环境;其次,我们证明了不同异质性维度的存在,并将平台和操作系统确定为最有影响力的因素。 FedGUI 为社区构建更具可扩展性和隐私保护的 GUI智能体 以进行实际部署提供了重要的基础。我们的代码和数据可在 https://github.com/wwh0411/FedGUI 上公开获取。