论文

LabFactory:构建和评估可执行的 AI 实验室

LabFactory: Building and Evaluating Executable AI Labs

智能体系统Agent 架构与控制循环

摘要

科学任务指定了所需的能力,但实现它通常需要构建一个适合该任务的计算系统——获取数据、设计表示、训练模型、实施工具以及决定如何在推理中使用它们。我们提出了 LabFactory,这是一个框架,人工智能构建者可以在其中将科学简报转化为可执行的人工智能实验室:一个特定于任务的求解器,在固定界面后面集成了模型、知识资源、工具和控制器。建造者在计量工作空间中开发和包装实验室;然后,一个单独的主机在保留的输入上执行交付的工件,参考标签保留在求解器的输入接口之外,并根据任务协议对其输出进行评分。这使得交付的系统,而不是构建者对其进度的描述,成为评估的对象。我们记录了七个科学任务类别中的 28 个选定结构——从分子和基因组预测到生理信号、临床决策支持和生物医学文本——其交付的实验室在主机端执行的所有 33 个子测试中都超出了其配置的参考值。十个包含在施工期间安装的预测模型;其他人围绕固定平台大语言模型组装检索系统、可执行分析环境和工具驱动的工作流程。它们共同表明,人工智能代理可以将科学简报一直带到工作实验室,在施工结束后仍然可以调用、检查和检查。