论文
使用 LLM-as-Judge 对 LLM 进行 5G 领域知识和故障分析的自由文本评估
Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge
摘要
5G 和新兴 6G 网络中的实际故障分析需要领域专业知识来分析自由文本诊断,包括根本原因解释和建议的操作。 LLM 已成为一种有前景的自动化方法,但轻量级、可边缘部署的模型是否能够执行深入的自由文本诊断仍然是一个悬而未决的问题。虽然现有的基准测试依赖于具有固定答案的限制性 MCQ,但本文以自由文本生成格式评估 5G 领域理解和故障分析。过渡到这种范式需要在开放式诊断推理上评估轻量级、可边缘部署的人工智能模型,以及大规模验证这些文本输出的可靠框架。为了解决这个问题,我们在三个基准(TeleQNA ORAN FT、5G-Faults FT 和 TeleInter FT)的自由文本 5G 领域知识和故障分析任务上评估了三个轻量级 LLM、Claude-Haiku-4.5、GPT-5.4-Mini 和 Gemini-3.1-Flash-Lite。三位独立的前沿法官对输出进行评分,并衡量成对的法官间一致性,作为 LLM-as-Judge 方法的实证检验。所有三个模型的故障诊断准确率均达到至少 90%,而 3GPP 和 O-RAN 规范的零样本召回仍然是关键差距,所有模型的得分均低于 60%。在所有运行中,评委间的平均一致性至少为 0.90,这表明多评委 LLM 评分可以为开放式电信回答产生一致的、可重复的等级。在操作上,Gemini-3.1-Flash-Lite 提供了最佳的效率权衡,将具有竞争力的准确性与最低的推理成本和延迟相结合,使其成为生产电信部署的最合适候选者。