论文
TeleResilienceBench:量化电信领域 LLM 推理的弹性
TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications
摘要
在电信领域部署 大语言模型 需要的不仅仅是任务准确性。在现实的工作流程中,模型可能会从先前步骤、上游代理或其自己的早期代继承部分完成的推理,并且即使已经出错,也必须继续该推理。我们引入了 TeleResilienceBench,这是一个基准,可以跨来自 GSMA Open-Telco LLM 套件的七个电信子域量化这种能力(我们称之为推理弹性)。实例是通过从弱生成器模型收集故障、在中点截断有缺陷的推理轨迹并要求目标模型继续并纠正它来构建的。我们建议将正确翻转率 (CFR) 作为成功恢复的直接衡量标准,并评估 Qwen3.5、Gemma4 和 Nemotron-3 系列的八个模型。我们的结果表明,即使是最强大的模型,宏观平均 CFR 也仅为 29.1%,而且规模并不能可靠地提高家庭内部的复原力。 Nemotron-3-nano 4b 的性能优于包括 27b 模型在内的所有 Qwen3.5 变体,并以 23.4% CR% 领先辅助 TeleMath 数值评估,提供了该组中最佳的弹性成本比。难度分层分析进一步表明,现有的电信基准难度标签反映的是事实特异性而不是推理深度,这表明当前的评估更多地衡量知识覆盖范围而不是推理能力。