论文
貌似合理却出错:天体物理工作流中的智能体失效案例研究
Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows
摘要
智能体AI系统正日益被整合进科学工作流,但其在现实条件下的行为仍缺乏充分理解。我们在两种工作流范式与十八个天体物理任务上评估CMBAgent。在One-Shot设定下,能否获取领域专属上下文带来约6倍的性能提升(0.85 对比无上下文时的约0),主要失效模式是静默的错误计算——语法有效的代码产出貌似合理却不准确的结果。在Deep Research设定下,系统在压力测试中频繁出现静默失效,产出物理上不自洽的后验分布且无自我诊断。总体而言,系统在定义良好的任务上表现出色,但在旨在探测推理极限的问题上性能下滑,且往往没有可见的错误信号。这些发现凸显出,智能体科学工作流中最令人担忧的失效模式不是显性失败,而是自信地生成错误结果。我们发布评估框架,以便对科学AI智能体开展系统性可靠性分析。
