论文
FIRE-Bench:评估重新发现科学见解的代理
FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights
摘要
由大语言模型(LLM)驱动的自主 Agent 有望端到端加速科学发现,但严格评估其可验证发现能力仍是核心挑战。现有基准面临权衡:要么严重依赖以 LLM 为裁判对自动生成的研究产出进行评估,要么优化便利却孤立的性能指标,只能为科学洞见提供粗糙代理。为填补这一空白,我们提出 FIRE-Bench(Full-cycle Insight Rediscovery Evaluation),一个通过让 Agent 重新发现来自近期高影响力机器学习研究的既有结论来评估其能力的基准。Agent 只拿到一个从已发表、已验证研究中提取的高层研究问题,必须自主探索想法、设计实验、实现代码、执行计划,并得出有经验证据支持的结论。我们在 FIRE-Bench 上评估了一系列以 gpt-5 等前沿 LLM 为骨干的最先进 Agent。结果显示,全流程科学研究对当前 Agent 系统仍具挑战:即便最强的 Agent 重新发现成功率也有限(F1 低于 50),跨运行方差高,并在实验设计、执行与基于证据的推理中呈现反复出现的失败模式。FIRE-Bench 为衡量通向可靠 Agent 驱动科学发现的进展提供了严谨且具诊断性的框架。
