论文

GoLongRL:具有多任务对齐能力的长上下文强化学习

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

模型训练强化学习

摘要

我们推出了 GoLongRL,这是一种完全开源、面向能力的 后训练 配方,用于具有可验证奖励的长上下文强化学习 (RLVR)。现有的长上下文强化学习方法通​​常将数据构建视为设计日益复杂的检索路径的问题,从而导致任务覆盖范围和奖励公式同质化,而不能充分反映实际的长上下文要求。我们的工作有两个贡献。 (一)以能力为导向的数据建设,全面开放发布。我们公开发布了 23K RLVR 样本的数据集、完整的构建流程以及所有训练代码。在长上下文功能分类法的指导下,该数据集涵盖 9 种任务类型,每种任务类型都与其自然评估指标配对。它包括来自已建立的语料库的精选开源样本和合成样本,这些样本的 QA 对是根据书籍、学术论文和多轮对话等真实源文档生成的。在相同的普通 GRPO 设置下,我们的数据集本身就优于闭源 QwenLong-L1.5 数据集。此外,我们在这些数据上训练的 Qwen3-30B-A3B 模型提供了与 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 相当的长上下文性能,这表明更广泛的覆盖范围和更大的奖励多样性大大有利于长上下文能力的提高。 (2)用于异构多​​任务优化的TMN-Reweight。为了解决异构奖励带来的优化挑战,我们提出了 TMN-Reweight,它将跨任务奖励规模对齐的任务级均值归一化与难度自适应加权相结合,以实现更可靠的优势估计。 TMN-Reweight 进一步提高了普通 GRPO 的平均性能,在报告的评估中保留或改进了一般能力。