论文

CTBench:评估AI智能体在真实电信网络运维中的排障能力

CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations

智能体系统Agent任务评测

摘要

智能体日益被考虑用于自动化网络运维,其中工程师必须诊断网络故障、优化配置以提升服务,并在严格约束下行动的同时降低运营成本。然而,现有评估未能准确建模真实网络特性,或无法在具有多元供应商、设备、协议和接口的部分可观测电信环境下评估智能体。在本文中,我们提出CTBench,一个公开基准,用于评估智能体的行为是否像一名胜任的电信排障工程师。CTBench聚焦根因分析和路径恢复。每个任务由专家构建,并标注丰富的任务元数据,包括参考证据步骤。CTBench使用以专家为依据的指标,同时评估最终答案和诊断证据。用代表性harness-模型组合进行的实验表明,最先进的智能体在路径恢复任务中识别端点方面表现很好,但总体而言在根因分析上表现不佳。智能体尤其难以处理接口状态、链路层、服务管理等运维故障。最重要的是,即使智能体给出看似合理或正确的最终答案,它们也常常无法提供运维实践所需的证据锚定的诊断。我们的结果还表明,路径恢复通常更耗费资源,而更大的资源使用并不必然转化为更好的诊断。

CTBench:评估AI智能体在真实电信网络运维中的排障能力:论文配图
图2:CTBench 自动评估框架。