论文
哪些token重要:经相对惊奇指数的RLVR自适应token选择
Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index
摘要
强化学习 (RL) 已成为推动大型语言模型 (LLM) 超越基于模仿的训练,迈向更强大的推理能力的强大工具。在现有方法中,带有可验证奖励的强化学习 (RLVR) 已成为推进 LLM 推理的关键范例。尽管在实证上取得了成功,但最近的研究提供了不同的见解。一种调查主张在训练期间优先考虑高熵令牌位置,而另一种观点则警告不要允许低概率令牌主导梯度更新。值得注意的是,尽管高熵令牌通常与低概率相关,但这两种范式从经验上都产生了显着的性能增益。在这项工作中,我们认为单独评估采样令牌概率或熵不足以捕获策略优化动态。为了解决这种紧张关系,我们引入了相对惊喜指数(RSI),这是一种有原则的信息论度量,它自然地将令牌的熵与所选令牌的概率结合起来。我们表明,在温和条件下,RSI 与选定 Logit 扰动下 Logit 梯度范数的一阶变化和预测熵之间的局部比率相关。在 RSI 的基础上,我们提出了 RSI 选择 (RSI-S),这是一种熵自适应令牌过滤方法,可将令牌保留在稳定的 RSI 区间内。 RSI-S 成功地协调了先前的矛盾范式,并过滤掉了冗余的低意外标记和不稳定的高意外尾部标记。实证评估表明,RSI-S 在 AIME 和 AMC 基准上在不同模型尺度(Qwen2.5-1.5B、3B 和 7B)上实现了更高的 avg@32 精度:RSI-S 比 GRPO 提高了 avg@32 精度 2--3 个百分点。总体而言,RSI 为 RLVR 的改进提供了一个充满希望的前景。
