论文
材料自动研究:验证研究决策及其在保留数据上的迁移
Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer
摘要
自动研究让语言模型 Agent 闭环提出、实现和评估机器学习改动,但最终流程分数不能说明哪个决策带来收益,也不能区分可复用发现与对开发反馈的适配。论文提出以干预为中心的自动研究,验证具体研究决策而不只评价最终产物。特征、模型、表示与数据四个方向分别通过内层五折反馈搜索;各方向获胜方案冻结后,用循环未见的外层保留数据矩阵比较全部替代方案。十项 Matbench 任务共 701 次 Agent 尝试中,外层证据在九项上确认选中干预,保留 89.3% 非平局的干预排序,同时否定一项内层反馈认可的总体表示收益。比较显示,只有成分信息的任务支持多种改善路径,有结构信息的任务更偏向局部几何特征与互补树集成。后续兼容性测试将冻结的特征和模型代码直接组合,无额外搜索或调参,平均外层保留数据改善由 19.0% 提至 26.3%。通过验证决策,此设计把固定评估器下的自适应搜索转为可复用证据。