论文

超越 pass@1:面向长程 LLM 智能体的可靠性科学框架

Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

现有基准衡量的是能力——模型单次尝试能否成功——而生产部署需要的是可靠性——在时长各异的任务上跨多次尝试持续取得成功。我们证明,随着任务时长增长,这两种属性会系统性地分化,而短任务上的 pass@1 在结构上无法察觉这种分化。我们提出一个面向长程 LLM 智能体的可靠性科学框架,包含四项指标:可靠性衰减曲线(Reliability Decay Curve, RDC)、方差放大因子(Variance Amplification Factor, VAF)、优雅退化评分(Graceful Degradation Score, GDS)和崩溃起始点(Meltdown Onset Point, MOP)。我们在一个涵盖四个时长区间和三个领域、包含 396 个任务的基准上,对 10 个模型进行了 23,392 个回合的评估。关键发现:(1) 可靠性衰减呈现领域分层——软件工程(SE)的 GDS 从 0.90 降至 0.44,而文档处理几乎持平(从 0.74 到 0.71);(2) VAF 按能力层级出现二分——高 VAF 是能力特征,而非不稳定信号;(3) 能力排名与可靠性排名差异显著,在长程任务上出现多级排名倒置;(4) 前沿模型的崩溃率最高(高达 19%),因为它们会尝试雄心勃勃的多步策略,而这些策略有时会失控螺旋;(5) 记忆脚手架在全部 10 个模型上均普遍损害长程性能。这些结果支持将可靠性与能力并列为第一等的评估维度。

超越 pass@1:面向长程 LLM 智能体的可靠性科学框架:论文配图
图 1:所有 10 个模型的可靠性衰减曲线(pass@1 与持续时间桶),ReAct 脚手架。前沿集群(DeepSeek V3、Kimi K2.5、MiniMax M2.5)在非常长时保持≥79%\geq 79\%;所有其他模型均显示出更大幅度的下降。 GLM-4.5 Air 是一个“泄漏边界”——短程最高@1,但长视界下降陡峭。 Llama 3.3 70B 显示出非常长的非单调恢复。