论文

科学人工智能的自动化数据准备

Automated Data Readiness for Scientific AI

AI 基础设施数据基础设施

摘要

领先的计算设施管理着大规模的科学数据集,这些数据集在用作人工智能训练数据之前通常需要进行大量转换。然而,现有的框架还没有完全统一自动化转换、准备情况评估、来源跟踪和代理本机部署。我们提出了 REDI,这是一个开源框架,它通过统一的五阶段管道(摄取、预处理、转换、结构和输出)来解决这一差距,并通过每阶段的仪器来实现可重复性和部署为代理可调用的技能;配套工具 SetGo 可自动执行 FAIR 合规性和目录发布。 REDI 对气候、蛋白质组学、材料科学和核聚变进行了评估,将所有数据集从原始数据集转换为 AI 就绪数据集,并根据领域专家参考资料对输出进行了验证,初步结果显示,针对气候案例,Frontier 上的并行扩展达到了近乎理想的 100 个节点。来源检测分析显示文件 I/O 是主要的管道成本,而格式选择是一阶优化杠杆。这些结果使 REDI 成为一个跨领域平台,为科学 AI 提供自动化数据准备,将数据准备瓶颈转化为可重复、可重用的社区资产。