论文
TeleSWEBench:用于评估电信领域 LLM 支持的软件工程的提交驱动基准
TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications
摘要
随着电信领域采用零接触管理以及新颖的 O-RAN 和 AI-RAN 框架,当代电信网络现在的功能非常复杂且高度软件化的代码库。虽然自动化软件工程 (ASE) 工具和软件工程 (SWE) 代理有可能缓解该领域的关键代码生成瓶颈,但它们导航和修改 srsRAN 5G 等专门的、数学上严格的无线堆栈的能力尚未得到验证。通用编码基准无法捕获电信的状态逻辑和严格要求,从而留下了严重的评估差距。在本文中,我们介绍了 TeleSWEBench,这是第一个提交驱动的基准测试,专门用于衡量代理在电信领域的性能。我们从 srsRAN 5G 存储库中挖掘真实的开发人员提交,并将其提炼成跨三个难度级别(简单、中等和困难)的结构化测试用例。我们的基准测试由 734 个问题组成,并附有可执行的单元测试。为了避免测试用例的僵化,我们进一步提出了一个分层的 LLM 作为名为 TeleJudge 的 Judge 框架,它在文件级别对代理输出进行评分并整体聚合判决。这是基于上下文和语义相似性的评估,与基于标准单元测试的评估并行。使用此基准测试,我们评估了 AIDER、OpenHands 和 ClaudeCode 框架,这些框架由最先进的推理 LLM 提供支持,包括 Qwen3、GPT OSS、Gemma 4、Kimi 和 Qwencoder 2.5。我们的两阶段评估表明,模型缺乏定位准确性和功能正确性,而最强大的 ASE 工具实现了高达 25% 的可交付更改。