论文
人工智能辅助工作流管理的复杂性和规模:联邦学习案例研究
Complexity and Scale in AI-Assisted Workflow Management: A Federated Learning Case Study
摘要
医学图像的联邦学习是一个要求很高的工作流程应用程序。每轮在并行的客户端作业中展开,并汇聚到为下一轮提供数据的聚合步骤。从规模上看,这会在四个站点的 GPU 上产生 101 个子工作流程和 2,679 个作业,这需要专家花费数月时间才能构建,主要是基于工作流程机制而不是科学。我们询问人工智能辅助可以在多大程度上实现此类工作流程的自动化。 LLM 代理基于 Pegasus 特定技能的已发布插件,首先生成可检查约束和验收标准的可审查规范,然后生成可执行工作流。验证循环修复运行时故障,根据这些约束检查代码,并仅根据规范重新生成实现。我们评估了三个 LLM 代理,报告 FABRIC 测试台上的端到端运行情况,并展示了对规范的一致性检查如何捕获故障驱动调试错过的三个无声错误,其中包括一个在随机张量上训练 1,700 个作业的错误。