论文

Sibyl-AutoResearch:自主研究需要自我进化的试错工具,而不是纸张生成器

Sibyl-AutoResearch: Autonomous Research Needs Self-Evolving Trial-and-Error Harnesses, Not Paper Generators

智能体系统Agent Harness

摘要

自主研究系统越来越多地使科学工作流程变得可执行:代理可以提出想法、运行代码、检查结果和起草论文。但可执行的工作流程本身并不产生研究判断。我们分析了当前系统在哪些方面失去了审判经验:薄弱的证据变成了散文,试点信号变成了广泛的主张,记忆仍然是文本,反复出现的过程失败不会改变后来的行为。我们推出了 Sibyl-AutoResearch,这是一个围绕科学试错工具构建的自我进化的 AutoResearch 框架。Harness可以让代理运行有界试验,保留积极和消极的结果,并将经验教训用于以后的规划、验证、索赔范围、日程安排、批评、写作和Harness修复。我们通过两个可审计的转换单元将其形式化:试验到行为的转换,它将试验信号与后续的研究行动联系起来;以及试验到利用行为的转换,它将反复出现的流程故障与系统更新联系起来。我们在 SIBYL 中实现了该框架,SIBYL 是一个文件支持的自主研究系统,可公开检查这些转换路径所需的状态、角色、内存、门和工件跟踪。回顾性审核确定了 8 个高可信度转换事件,其中位延迟为一次迭代,最大延迟为 3 次迭代。恢复故障注册表进一步显示了五个自然发生的故障类别(包括重复结果、过时的数字和不受支持的统计数据)如何被阻止、降级或路由到以后的修复。这些痕迹并不构成比较性能声明;他们表明,所提出的转换单元可以从现实的自主研究工作空间中恢复。 SIBYL 框架和系统可在 https://github.com/Sibyl-Research-Team/AutoResearch-SibylSystem 获取。