论文
推理还是记忆?LLM强化学习中的方向感知多样性探索
Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning
摘要
强化学习已成为在大型语言模型中激发推理能力的关键范例,其中探索对于发现有效的解决方案轨迹至关重要。现有的探索方法通常鼓励语义或梯度空间的多样性,而不区分驱动这种多样性的因素。一条轨迹可能会显得新颖,因为它遵循新的推理过程,或者因为它改变了记忆的模式和捷径。对这两种情况给予同等奖励可能会引导探索转向记忆而不是真正的推理改进。在本文中,我们提出了 DiRL,一种方向感知强化学习框架,它将探索锚定到策略的内部推理记忆方向。具体来说,DiRL 从模型表示中提取这个方向,构建方向加权梯度特征来表征采样轨迹更新,并塑造奖励以放大推理对齐的探索,同时抑制记忆对齐的变化。 DiRL 无缝集成到标准组相对策略优化 (GRPO) 中。对数学和一般推理基准的大量实验证明了 DiRL 的有效性,显示出相对于各种现有探索方法的显着改进。
