论文

CARM:LLM 强化学习的取消感知响应屏蔽

CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning

模型训练强化学习

摘要

近年来,强化学习(RL)被广泛用于大语言模型(LLM)后训练,提升数学推理和代码生成能力。但实际系统中的策略更新以及rollout与训练引擎差异,可能使采样响应成为离策略数据。序列级掩码决定整条响应是否参与优化,以处理这种不匹配。常见规则使用采样词元概率比的长度归一化几何平均值,但带符号的对数比率会在不同位置相互抵消,掩盖显著的双向策略漂移。我们提出抵消感知响应掩码(CARM),先取每个词元对数比率的绝对值再求平均,避免相反的概率变化抵消。我们证明,被接受响应中超出指定区间的采样词元比率占比,以及越界部分的平均对数距离,满足一个联合界限。数学推理和代码生成实验表明,CARM在AIME 2024/2025/2026及BeyondAIME上的平均mean@16相对几何平均掩码最高提高$3.13$个百分点;四个代码基准的平均pass@1相对被评估的最强基线提高$2.88$个百分点。结果支持CARM作为有理论依据的LLM强化学习响应级离策略控制方法。