论文

FIRE-Bench:评估重新发现科学见解的代理

FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights

智能体系统Agent任务评测

摘要

由大语言模型(LLM)驱动的自主 Agent 有望端到端加速科学发现,但严格评估其可验证发现能力仍是核心挑战。现有基准面临权衡:要么严重依赖以 LLM 为裁判对自动生成的研究产出进行评估,要么优化便利却孤立的性能指标,只能为科学洞见提供粗糙代理。为填补这一空白,我们提出 FIRE-Bench(Full-cycle Insight Rediscovery Evaluation),一个通过让 Agent 重新发现来自近期高影响力机器学习研究的既有结论来评估其能力的基准。Agent 只拿到一个从已发表、已验证研究中提取的高层研究问题,必须自主探索想法、设计实验、实现代码、执行计划,并得出有经验证据支持的结论。我们在 FIRE-Bench 上评估了一系列以 gpt-5 等前沿 LLM 为骨干的最先进 Agent。结果显示,全流程科学研究对当前 Agent 系统仍具挑战:即便最强的 Agent 重新发现成功率也有限(F1 低于 50),跨运行方差高,并在实验设计、执行与基于证据的推理中呈现反复出现的失败模式。FIRE-Bench 为衡量通向可靠 Agent 驱动科学发现的进展提供了严谨且具诊断性的框架。

FIRE-Bench:评估 AI Agent 重新发现科学洞见
图2:FIRE-Bench 向 AI 研究智能体提出一个来自已发表研究的高层研究问题,并评估其自主重新发现该研究核心实证结论的能力。这种设定使智能体的端到端研究过程能够与原始人类工作流程进行细粒度比较。