论文

LongAct:利用内在激活模式进行长上下文强化学习

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 已成为增强 大语言模型 (LLM) 推理能力的关键驱动力。虽然最近的进展集中在奖励工程或数据合成上,但很少有研究利用模型的内在表示特征来指导训练过程。在本文中,我们首先观察在处理长上下文时查询和关键向量中是否存在高幅度激活。从模型量化(它确定了这种高幅度激活的关键性)中汲取灵感,并认识到长上下文推理本质上表现出稀疏结构,我们假设这些权重是有效模型优化的关键驱动因素。基于这一见解,我们提出了 LongAct,一种从统一更新转向显着性引导稀疏更新的策略。通过选择性地仅更新与这些重要激活相关的权重,LongAct 在 LongBench v2 的基础上实现了大约 8% 的改进,并增强了 RULER 基准的泛化能力。此外,我们的方法表现出显着的通用性,能够持续提高 GRPO 和 DAPO 等各种 RL 算法的性能。广泛的消融研究表明,关注这些显着特征是释放长情境潜力的关键。