论文

貌似合理却出错:天体物理工作流中的智能体失效案例研究

Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

智能体系统Agent HarnessAgent任务评测

摘要

智能体AI系统正日益被整合进科学工作流,但其在现实条件下的行为仍缺乏充分理解。我们在两种工作流范式与十八个天体物理任务上评估CMBAgent。在One-Shot设定下,能否获取领域专属上下文带来约6倍的性能提升(0.85 对比无上下文时的约0),主要失效模式是静默的错误计算——语法有效的代码产出貌似合理却不准确的结果。在Deep Research设定下,系统在压力测试中频繁出现静默失效,产出物理上不自洽的后验分布且无自我诊断。总体而言,系统在定义良好的任务上表现出色,但在旨在探测推理极限的问题上性能下滑,且往往没有可见的错误信号。这些发现凸显出,智能体科学工作流中最令人担忧的失效模式不是显性失败,而是自信地生成错误结果。我们发布评估框架,以便对科学AI智能体开展系统性可靠性分析。

貌似合理却出错:天体物理工作流中的智能体失效案例研究:论文配图
图 12:T4 模型预测与观测到的爱因斯坦半径 θEin\theta_{\mathrm{Ein}}。此处的一致性比速度离散度更接近 1:1 线,与正确实施的 SIS 模型一致,但总体校准有所偏移。