论文
生产级 AutoResearch:十二周实验中的失败模式与支撑框架
AutoResearch at Production Scale: Failure Modes and a Multi-Agent Framework
摘要
优化生产推荐管道的嵌入系统需要系统性探索,这会大规模消耗不成比例的工程工作量。我们应用 Andrej Karpathy 的 AutoResearch 范例(一种大型语言模型,它迭代地编辑训练脚本并保留能改善留出集标量指标的修改)来自动执行此探索。我们报告了在生产规模上运行此范例的 12 周,其中迭代消耗了数小时的多 GPU 计算,评估涉及相互竞争的指标,并且活动跨多个训练作业持续数周。在两个独立开发的图书推荐管道表示学习系统中,我们进行了 220 多项实验,观察到原始设置中不存在的五种重复出现的故障模式:基础设施脆弱性、代理记忆衰退、搜索方向停滞、迭代成本不对称和指标固着。我们贡献了一个三原则脚手架设计——预防、持久、重定向——将每种故障模式映射到结构补救措施,并且其实例化随着迭代成本而扩展。与手动调整的基线相比,该框架产生了 1.82 倍的 Recall@6 提升和 2.1 倍的一致性提升,并且代理自主设计了纯文本回退,将目录覆盖范围扩大了 5.8 倍。这两个系统的每次迭代成本相差近三个数量级,但表现出相同的故障模式,表明这些是生产规模自主研究的结构特性,而不是任一应用程序的产物。