论文

Collider-Bench:通过粒子物理分析再现对 AI 代理进行基准测试

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

智能体系统Agent任务评测

摘要

自主语言模型代理越来越多地在长期工具使用任务上进行评估,但现有的基准很少捕捉到真正科学工作的复杂性和细微差别。为了解决这一差距,我们引入了 Collider-Bench,这是一个基准,用于评估 LLM 代理是否可以仅使用公开论文和开放科学软件重现大型强子对撞机 (LHC) 的实验分析。这种分析通常很难重现,因为公共工具链仅近似于实验合作内部使用的软件,而已发表的论文不可避免地省略了忠实重建所需的实现细节。因此,智能体必须依靠物理推理、领域知识和反复试验来填补这些空白。每个任务都要求代理将已发布的分析转换为可执行的模拟和选择管道,并提交指定信号区域中的预测碰撞事件产量。这些预测是使用标准直方图指标进行评估的,这些指标可以提供连续的保真度分数,而无需手写的评分标准。我们还报告每个代理每个任务所产生的计算成本。最后,我们使用 LLM 判断来评估代码库和完整会话跟踪,以捕获定性故障模式,例如捏造、幻觉和重复。我们发布了一组从大型强子对撞机搜索中提取的初始任务,以及容器化沙箱和事件模拟工具。我们通过通用 编码智能体 的能力阶梯进行评估。我们的结果表明,平均而言,没有代理能够可靠地击败物理学家在环解决方案。