论文

TelecomGPT-R1:电信堆栈的统一开源推理机

TelecomGPT-R1: A Unified Open-Source Reasoner for the Telecom Stack

模型训练强化学习

摘要

电信是基于 大语言模型 (LLM) 的推理的高杠杆领域,因为常规工程工作流程需要在规范规范、操作遥测、特定于供应商的故障证据和精确的 RF/网络计算方面综合证据对齐。然而,当前电信中的 LLM 集成仍然受到两侧能力差距的瓶颈:通用推理器通常缺乏电信特定的基础,而特定领域的电信 LLM 在结构化、多步骤推理方面仍然受到限制。为了弥补这一差距,我们发布了 TelecomGPT-R1-9B,这是一款统一的开源电信推理机,在 GSMA 开放电信排行榜上名列前茅。具体来说,我们策划了一个包含 67,427 个示例的监督 微调 (SFT) 语料库,围绕四个互补的推理轴组织:协议、知识、建模和故障。该语料库是根据轴匹配的公共网络资源构建的,并通过特定轴的思想链 (CoT) 生成和前缀延续自我验证进行增强。从Qwen3.5-9B开始,我们进一步开发了两阶段后训练配方。首先,基于多教师低秩适应(LoRA)的 SFT 注入电信知识并引入特定于轴的推理格式。其次,通过解耦剪辑和动态采样策略优化(DAPO)稳定的组相对策略优化(GRPO),使用四轴对齐的二进制验证器奖励来优化策略。在七个公共电信基准测试中,TelecomGPT-R1-9B 在开源电信 LLM 中排名第一,并实现了与最先进的闭源前沿推理器相当的七轴平均值。