论文

LongStraw:在固定 GPU 预算下超过 2M 词元的长上下文强化学习

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

AI 基础设施分布式训练基础设施

摘要

长上下文 RL 后训练 受到状态和梯度的生命周期的限制,而不仅仅是注意力成本。在 GRPO 中,一个数百万词元的提示必须服务于旧策略和参考评分以及多个策略响应,而传统的 autograd 则保持提示图和所有响应图与模型权重、缓存和分布式通信缓冲区一起存在。我们推出了 LongStraw,一个目标感知、架构感知的系统,用于常驻状态虚拟化、响应重放和分布式梯度执行。其事务在没有 autograd 的情况下捕获共享提示,仅在显式拥有的页面上保留体系结构所需的状态,为每个组成员恢复该状态,在没有图表的情况下对旧/参考分支进行评分,使用 autograd 一次重放一个策略响应,并在一个分布式最终确定和优化器步骤之前累积结果梯度。该计划通过响应后缀限制实时训练图,同时在整个 GRPO 组中重复使用昂贵的提示计算。我们针对两个不兼容的模型结构实例化了这种设计。 Qwen3.6-27B结合了48个循环GDN层和16个全注意力层; LongStraw 保持紧凑的循环状态和物理 CP8 分片的 KV 页,通过跨等级 LSE/输出合并组成全局注意力,并执行块式响应重放。 GLM-5.2 将 78 层 MLA/DSA 注意力堆栈与 256 名专家、top-8 MoE 尾部相结合。其实现将 CP 分片的 MLA 潜在页面和 DSA 索引器密钥页面保留在 CPU 内存中,一次暂存一层,通过 CP32 重建 IndexShare 感知的全局稀疏选择,并通过 EP32 调度路由响应词元。这两条路径共享一个交易合约,同时专门保留状态、重放运算符和与架构的集体通信......