论文

ORCA-bench:语言模型代理为 Oncall 做好了准备吗?

ORCA-bench: How Ready Are Language Model Agents for Oncall?

模型评测基准与评测资源

摘要

大语言模型 可以编写、修补和搜索代码,但待命根本原因分析 (RCA) 需要不同的东西:对嘈杂的指标、日志、跟踪和源代码进行推理,从模糊的面向用户的报告开始,通常是在事件开始数小时后。我们推出了 ORCA-bench,这是一个将通用 编码智能体 置于生产保真度 oncall 设置中的基准测试。 ORCA-bench 将 1,079 个 RCA 任务与在连续模拟用户负载下从 OpenTelemetry 检测的微服务系统收集的六天指标、日志和跟踪数据配对。代理通过真正的可观察性接口(Prometheus、Jaeger 和通过 Grafana 的 OpenSearch)调查记录的历史记录,并具有对应用程序源代码的完全访问权限。任务系统地改变报告的特异性、检测时间和同时发生的故障场景。 真值 症状由专家 SRE 策划和签署,我们的 LLM 作为法官由人类独立重新评分(Cohen 的 $κ_w = 0.91$)。在五个前沿代理中,中等难度任务(现实输入设置)的最佳 RCA 准确度为 25.3%,困难任务为 10.0%,即使是《克劳德寓言 5》,这一差距仍然存在。最弱的模型在 40% 的事件报告中产生了令人难以置信的根本原因,而删除源代码访问会降低 RCA 准确度并增加每个评估模型的幻觉率。这些结果来自在代码和工具公开的系统上精心策划的 50 GB/六天独立任务测试台。由于真实的生产系统要大几个数量级、更加动态且更加特殊,因此我们报告的差距强调了在代理获得生产可靠性之前仍需要进行工程工作。我们在 https://hub.harborframework.com/datasets/orca-bench/orca-bench 发布了公共集。