OpenDiscoveryTrace:科学Agent工作流的过程轨迹
OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows
摘要
自主人工智能科学家的现有基准仅评估最终输出——生成的代码、假设或论文——但放弃了获得这些输出的推理过程。这使得审核科学方法、诊断故障模式或区分系统推理和幸运猜测变得不可能。我们提出了 OpenDiscoveryTrace,这是一个包含 558 个完整 AI 科学智能体轨迹的公共数据集,它捕获模型如何推理,而不仅仅是它们产生的结果。当模型执行涵盖药物发现、材料科学、基因组学和科学文献分析的 124 项科学任务时,每个轨迹都会记录结构化的每步 9 个字段的跟踪,包括思想、工具调用、观察、错误、修订触发器和自我报告的置信度。该数据集涵盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;每个 124 个轨迹,跨领域和难度级别完全平衡)和四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;每个 30 个)以及 60 个模型实时检索变量轨迹。对 363 个 LLM 判断轨迹的试点分析表明,过程轨迹暴露了仅输出评估不可见的行为差异:所有三个前沿模型都达到了相当的成功率 (84--89%),但 Claude Opus 4.6 产生的错误比 GPT-5.4 多 30$\times$(每个轨迹 2.5 vs. 0.08,$p < 0.0001$,Cliff 的 $\delta = 0.613$),错误情况在性质上有所不同——Claude 的工具误用率为 66.7%,而 GPT-5.4 的推理错误率为 83.6%。我们使用逻辑回归、随机森林、LSTM 和 Transformer 模型的基线定义了五个基准任务。数据集、跟踪模式、智能体工具和基准定义在 CC BY 4.0 下公开,以支持流程级评估、科学智能体审计和人工智能治理的研究。