论文
FARS:大规模部署的全自动研究系统
FARS: A Fully Automated Research System Deployed at Scale
摘要
最近的自动化研究系统表明,语言模型代理可以生成假设、运行实验并撰写完整的手稿,但大多数证据仍然来自选定的示例、人类框架的主题或一些预定义的研究任务。我们推出了 FARS(全自动研究系统),这是一个全自动的 AI-for-AI 研究系统,旨在大规模跨研究主题运行。 FARS 通过构思、规划、实验和写作,使用特定阶段的代理,通过记录提案、代码、日志、结果和手稿的共享工作空间进行协调,自主生成和推进项目。在首次公开部署中,FARS 生成了 166 篇完整的研究论文,涵盖 67 个细粒度的 AI/ML 主题,同时将中间工件保留为可审计的语料库,而不是一组精选的成功案例。我们通过志愿者评审员对 140 篇论文的 282 条结构化评审进行了评估,包括总体评分、分项评分、完整性检查和 LLM 使用披露。审查表明,FARS 可以在大规模公共部署中产生值得审查的、偶尔强大的 AI/ML 研究成果,同时也暴露了在狭窄的实验范围、方法学限制和完整性问题中反复出现的故障模式。
