论文
通过双通道 CoT 集成增强电信 LLM 的置信度估计
Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling
摘要
大语言模型 (LLM) 越来越多地应用于复杂的电信任务,包括 3GPP 规范分析和 O-RAN 网络故障排除。然而,一个关键的限制仍然存在:LLM 生成的置信度分数通常有偏差且不可靠,经常表现出系统性的过度自信。缺乏值得信赖的自我评估使得验证模型输出并在实践中安全地依赖它们变得困难。在本文中,我们使用代表性的 Gemma-3 模型系列(4B、12B 和 27B 参数)研究电信领域 LLM 的置信度校准,并在 TeleQnA、ORANBench 和 srsRANBench 上进行评估。我们表明,标准的单遍、语言化的置信度估计无法反映真正的正确性,通常会为错误的预测分配高置信度。为了解决这个问题,我们提出了一种新颖的双通道思想链(CoT)集成方法,通过利用多个独立推理评估并将其评估汇总为校准的置信度分数来改进置信度估计。我们的方法在基准测试中将预期校准误差 (ECE) 降低了高达 88%,从而显着提高了模型自我评估的可靠性。这些结果凸显了当前置信度估计实践的局限性,并展示了对电信领域的 LLM 输出进行更值得信赖的评估的实用途径。