论文

TeleCom-Bench:大语言模型距离工业电信应用还有多远?

TeleCom-Bench: How Far Are Large Language Models from Industrial Telecommunication Applications?

模型评测基准与评测资源

摘要

尽管大语言模型已在各种垂直场景中实现了显著落地,但由于缺乏标准化评估框架,其在电信领域的部署仍处于探索阶段。现有电信基准主要关注静态基础知识与孤立的原子技能,忽略了对现实生产系统至关重要的设备专用文档和端到端工业工作流。为弥合这一差距,我们提出TeleCom-Bench,一个包含12个评测集、22,678个精选样本的综合基准,通过协同分层体系评估LLM:(1) 多维知识理解,通过知识图谱驱动的综合,将电信基础知识、3GPP协议和5G网络架构与跨有线网、核心网和无线网的专有产品知识相整合;(2) 端到端知识应用,基于现网智能体工作流的真实轨迹形式化六项核心任务,包括意图识别、实体抽取、事件核实、工具调用、根因分析和方案生成,覆盖网络优化与故障运维场景。对八个最先进LLM的评估揭示了一个普遍的“执行墙”:模型在意图识别和实体抽取等语言接口任务上可达90%的准确率,而在方案生成等程序化执行任务上性能骤降至约30%。这一能力差距表明,当前LLM能够胜任诊断师的角色,却无法胜任一线工程师的工作。TeleCom-Bench提供标准化诊断以精确定位这一短板,为面向生产级电信智能体的领域对齐提供可操作的指导。数据集与评估代码已发布于 https://github.com/ZTE-AICloud/TeleCom-Bench。

TeleCom-Bench:大语言模型距离工业电信应用还有多远?:论文配图
图1:TeleCom-Bench的分层评估结构:知识理解与知识应用两级。