论文

超越执行:审计 LLM 驱动的科学研究中的实验保真度

Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research

智能体系统Agent 动作执行与治理

摘要

用于科学实验的 LLM 代理必须做的不仅仅是生成可执行代码:它们必须忠实地实现参考方法,设计测试论文主张的实验,并提供支持这些主张的证据。我们表明,智能体经常产生方法论幻觉:默默地减少数据集或训练预算,用查找或预言函数替换失败的学习或生成组件,或者从方法声称的优势消失的资源有限的环境中得出结论。为了检测这些故障,我们引入了 ABE-Ralph,这是一个参考锚定的审核框架,它将声明、协议、所需组件、基线和指标表示为结构化实验约束,通过 8 步工作流程指导实施,并执行定量、定性和代码级验证。在涵盖 12 个机器学习领域的 30 次长期再现运行中,ABE-Ralph 实现了 93% 的稳健执行率,并识别了五种科学故障模式。在 23 项 NatureBench 发现任务中,ABE-Ralph 在 5 项任务上达到或超过了最先进的性能。这些结果表明,对人工智能科学家的可靠评估必须评估实验设计是否忠实地测试了预期的主张以及由此产生的证据是否支持它,而不是将代码执行或合理的指标视为科学成功的证据。