论文
ROAR:统一异构 AI 研究系统的运行记录
ROAR: Unifying Runs across Heterogeneous AI-Driven Research Systems
摘要
人工智能驱动的研究系统 (ADRS) 的每次运行都是在巨大的解决方案空间中进行昂贵的搜索,而可靠的评估需要多次运行,这使得运行数据的生成成本高昂,但保留用于大规模分析的价值却很高。然而,这些数据仍然支离破碎:团队独立运作,ADRS 框架以不同格式发出结果,并且不存在用于聚合或比较跨问题和系统的运行的共享基础设施。我们推出了 ROAR,这是一种用于系统地统一和分析异构 ADRS 输出的解决方案。 ROAR 解决了两个挑战:协调异构 ADRS 输出以及支持跨具有不同目标和评分功能的运行进行分析。我们通过关系模式和解析层来实现这一目标,该层可以规范异构 ADRS 输出,同时保留数据沿袭和时间结构,并在不需要模式修改的情况下适应新系统。通过从多个 ADRS 构建超过 900 次运行的语料库,我们展示了汇总数据如何揭示难以观察的问题景观的属性。与之前的工作一致,具有相同配置的运行可能会收敛到不同的分数。我们发现,许多运行很早就实现了大部分收益,并且将先前解决方案纳入搜索过程的不同策略的有效性因问题而异。我们进一步表明,通过使用 ROAR 配置 ADRS 运行,汇集的语料库是可操作的,而不仅仅是分析性的。这些结果共同说明了汇总的 ADRS 数据如何揭示搜索行为中与问题相关的结构,而这些结构很难从任何单个系统、团队或基准中检测到。当运行仍然处于孤立状态时,很难获得这种跨领域的见解; ROAR 是第一个旨在统一它们的基础设施。
