论文
TelecomGPT-R1:异构电信任务推理的统一后训练
TelecomGPT-R1: Unified Post-Training for Reasoning Across Heterogeneous Telecom Tasks
摘要
大型语言模型 (LLM) 通过对标准、网络配置、数学模型、源代码和操作日志进行推理,为自动化各种电信工程任务提供了巨大的潜力。然而,现有的电信大语言模型很难对这些不同的任务和数据类型进行可靠的推理。通用大语言模型通常缺乏电信特定知识的可靠基础,而电信专用模型通常是为较小的任务系列开发的,并且表现出有限的多任务性能。为了填补这一空白,我们引入了 TelecomGPT-R1,这是一系列开源统一电信推理模型,围绕四个互补轴构建:协议、知识、建模和故障。我们首先开发了一个轴感知数据生成框架,将粗略的公共电信工件细化为经过验证的问答对和高质量的思维链 (CoT) 推理轨迹,生成包含 104,880 个示例的训练语料库。在此语料库的基础上,监督微调 (SFT) 灌输电信知识和循证推理模式,以克服强化学习 (RL) 的冷启动障碍。然后,我们应用动态采样策略优化 (DAPO) 和任务路由的评分标准奖励,以保持 RL 更新在异构电信推理任务中信息丰富且稳定。这些奖励将特定于轴的 CoT 轨迹分解为可验证的推理单元,并将扎根的密集过程信用与结果正确性相结合,使 RL 能够从可验证的电信证据中学习通用的问题解决行为。我们发布了 TelecomGPT-R1 模型和可重复的训练方案,以支持进一步的社区发展。对 GSMA 开放电信排行榜七项基准的评估显示,开源 TelecomGPT-R1-27B 的平均得分为 89.64%,优于 GPT-5、Claude 和 Gemini 等领先的专有模型。