论文

基准还不够:用于生产系统中代理模型运行时评估的 RAMP

Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems

智能体系统Agent任务评测

摘要

LLM 代理正在迅速从编码助手演变为自主软件工程系统。然而,现有的评估方法仍然主要集中在静态、孤立和短期的基准上,无法捕捉现实世界生产工作流程的动态复杂性。因此,基准测试性能可能很难反映在涉及长执行链、工具交互、依赖管理和迭代反馈循环的实际运行时环境下的实际能力。因此,我们提出了 RAMP,一种基于生产的基础设施,用于评估长期软件工程代理。 RAMP 基于 YatCC 集成平台构建,通过标准化编排和执行接口提供统一的运行时评估架构。 RAMP 引入了具有串行依赖性和复杂工具链交互的真实编译器构建工作负载,以及用于分析部分工作流故障下的执行行为的分阶段恢复机制。该框架进一步纳入了面向效用的多维指标,共同评估结果质量和流程效率。我们对 15 个主流模型进行了运行时评估,并观察到显着的性能下降,而传统的孤立基准测试在很大程度上仍然看不到这种情况。串行工作流程中的任务完成率逐渐崩溃,从初始阶段的 100% 下降到最终阶段的 20%,而没有一个评估的模型能够成功完成整个流程。运行时分析揭示了系统性故障传播和显着的资源效率低下,可比模型之间的计算成本相差高达三个数量级。这些发现表明 RAMP 将代理模型评估推向连续、运行时可观察和基于生产的评估。