论文

经研究测试框架外置AI科学家的研究综合与验证

Externalizing Research Synthesis and Validation in AI Scientists through a Research Harness

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

AI系统日益能自动化科学工作流——但连接先前证据、生成想法、实验与最终主张的推理常隐于模型推理内部。此处我们介绍Xcientist——把研究综合与实验验证外置为可检查、契约治理过程的研究测试框架。Xcientist把文献证据、想法状态、实现计划、消融记录与修复踪迹组织为持久研究工件——使生成的机制可被锚定、执行、测试与修订而不丢失证据基础。我们识别主张漂移为自动化研究的失败模式:可运行工件不再支持最初声称的机制。跨免训练记忆系统、图结构交通预测与多尺度物理信息神经网络——Xcientist保持从问题形式化到机制设计、验证与有界修订的可追溯轨迹。这些结果表明:AI科学家不仅应按最终工件评估——还应按其综合与验证过程是否保持可归因、可检查、科学可问责来评估。

经研究测试框架外置AI科学家的研究综合与验证:论文配图
图 3:Xcientist 架构概述。 Xcientist通过三层将隐含的文献知识转化为可审计的研究轨迹。 Paper Graph 基础设施从全文论文中提取显式知识结构,以支持方法演化、差距发现和证据检索。研究工具通过构思-验证-演化循环将研究综合与实验验证结合起来,其中候选想法以文献证据为基础,通过可执行的工作流程进行测试,并根据验证结果进行修订。系统用户界面公开工作流程状态和中间工件,允许用户检查和审计从证据到有限科学主张的路径。