论文
经研究测试框架外置AI科学家的研究综合与验证
Externalizing Research Synthesis and Validation in AI Scientists through a Research Harness
摘要
AI系统日益能自动化科学工作流——但连接先前证据、生成想法、实验与最终主张的推理常隐于模型推理内部。此处我们介绍Xcientist——把研究综合与实验验证外置为可检查、契约治理过程的研究测试框架。Xcientist把文献证据、想法状态、实现计划、消融记录与修复踪迹组织为持久研究工件——使生成的机制可被锚定、执行、测试与修订而不丢失证据基础。我们识别主张漂移为自动化研究的失败模式:可运行工件不再支持最初声称的机制。跨免训练记忆系统、图结构交通预测与多尺度物理信息神经网络——Xcientist保持从问题形式化到机制设计、验证与有界修订的可追溯轨迹。这些结果表明:AI科学家不仅应按最终工件评估——还应按其综合与验证过程是否保持可归因、可检查、科学可问责来评估。
