论文

FARS:大规模部署的全自动研究系统

FARS: A Fully Automated Research System Deployed at Scale

智能体系统Agent 架构与控制循环

摘要

最近的自动化研究系统表明,语言模型代理可以生成假设、运行实验并撰写完整的手稿,但大多数证据仍然来自选定的示例、人类框架的主题或一些预定义的研究任务。我们推出了 FARS(全自动研究系统),这是一个全自动的 AI-for-AI 研究系统,旨在大规模跨研究主题运行。 FARS 通过构思、规划、实验和写作,使用特定阶段的代理,通过记录提案、代码、日志、结果和手稿的共享工作空间进行协调,自主生成和推进项目。在首次公开部署中,FARS 生成了 166 篇完整的研究论文,涵盖 67 个细粒度的 AI/ML 主题,同时将中间工件保留为可审计的语料库,而不是一组精选的成功案例。我们通过志愿者评审员对 140 篇论文的 282 条结构化评审进行了评估,包括总体评分、分项评分、完整性检查和 LLM 使用披露。审查表明,FARS 可以在大规模公共部署中产生值得审查的、偶尔强大的 AI/ML 研究成果,同时也暴露了在狭窄的实验范围、方法学限制和完整性问题中反复出现的故障模式。

FARS:大规模部署的全自动研究系统:论文配图
图 1:FARS 架构概述。构思阶段通过迭代细化产生多个研究提案,并通过规划、实验和写作阶段接受提案。多个项目可以独立运行,同时共享公共管道结构。完成的手稿与代码存储库和支持工件配对。所有阶段通过共享工作区进行协调,该工作区充当持久项目内存和用于下游检查的工件存储;代理还可以访问补充工具和基础设施,包括网络资源、精选技能、具有 160 个 NVIDIA GPU 的 GPU 集群以及模型推理端点。