论文

SWE-Serve:面向生产推理服务的Agentic工程基准

SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving

智能体系统Agent任务评测

摘要

我们提出SWE-Serve,一个评测Agent在生产推理工程任务上能力的基准。实现一个推理特性可能需要协调服务栈多个部分的改动,包括模型支持、运行时执行和公共API。现有基准对生产推理工程的覆盖有限:仓库级软件工程基准不以推理为目标,而通用终端Agent基准只包含少量推理任务;专用推理基准则主要聚焦孤立的内核生成或性能优化,而非仓库尺度的生产特性实现。SWE-Serve提供了53个仓库扎根的任务,源自SGLang近期的生产改动,横跨六个推理工程族。每个任务在CPU或单张GPU(H100)上执行,并用隐藏的功能与回归测试评测,适用时还包括端到端(E2E)服务测试与经过校准的性能门。可执行的无操作与预言机对照、对抗性验证器审查和闭卷执行支持任务有效性与评测完整性。在11个模型和31个模型-算力配置中,表现最好的配置取得75%的平均pass@1。SWE-Serve揭示了在本地完成任务与达到生产正确性之间的巨大差距:在19个有端到端覆盖的任务上,模型服务E2E测试拒绝了大约三分之一通过了其他所有测试的补丁(计入验证器时为45.9%,而E2E测试不计入评分时为69.4%),且各模型最佳配置的通过率更高。通过使生产正确性差距可直接测量,SWE-Serve让领域能够追踪未来的Agent是否超越了在本地完成任务、迈向生产正确性。

SWE-Serve:面向生产推理服务的Agentic工程基准:论文配图
图 13:11 个各模型最优配置在工程类任务上的 pass@1,按平均 pass@1 排序,与表 3 一致。分数为每个配置在三次 SWE-Serve 运行上的平均值。任务数量标注在工程类列标签下方。橙色轮廓标出每个任务族中观测到的最高 pass@1(含并列)。Overall 列报告各配置在整个 SWE-Serve 基准上的平均 pass@1。Claude Opus 5 与 GPT-5.6 Sol 配置在全部任务上的平均 pass@1 最高,并在六个任务族中的五个(含并列)取得最高平均 pass@1。GPT-5.6 Luna 在分布式/调度类任务上的平均 pass@1 最高。