论文
过去并非过去:记忆增强的动态奖励塑造
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
摘要
尽管 大语言模型 的强化学习取得了成功,但常见的失败模式是采样多样性降低,其中策略反复生成类似的错误行为。经典的熵正则化在当前策略下鼓励随机性,但并没有明确阻止在采样轨迹中反复出现的故障模式。我们提出 MEDS,一种记忆增强型动态奖励塑造框架,它将历史行为信号纳入奖励设计中。通过存储和利用中间模型表示,我们捕获历史采样轨迹的特征,并使用基于密度的聚类来识别经常重复出现的错误模式。分配给更普遍的错误簇的轨迹会受到更严厉的惩罚,鼓励更广泛的探索,同时减少重复的错误。在五个数据集和三个基本模型中,MEDS 持续提高了现有基线的平均性能,实现了高达 4.13 pass@1 点和 4.37 pass@128 点的增益。使用基于 LLM 的注释和定量多样性指标进行的其他分析表明,MEDS 增加了采样期间的行为多样性。