论文

治愈熵崩溃:通过混合域熵动力学对齐增强少样本 RLVR 的探索

HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已被证明对于训练面向推理的 大语言模型 是有效的,但现有方法很大程度上假设具有丰富训练数据的高资源设置。在资源匮乏的情况下,RLVR 容易出现更严重的熵崩溃,这大大限制了探索并降低了推理性能。为了解决这个问题,我们提出了混合域熵动力学对齐(HEAL),这是一个为少样本 RLVR 量身定制的框架。 HEAL首先选择性地合并高价值的通用领域数据,以促进更多样化的探索。然后,我们引入熵动力学对齐(EDA),这是一种奖励机制,可以对齐目标域和一般域之间的轨迹级熵动力学,捕获熵大小和细粒度变化。通过这种调整,EDA 不仅进一步减轻了熵崩溃,还鼓励策略从通用领域获取更多样化的探索行为。跨多个领域的实验表明,HEAL 持续提高了小样本 RLVR 性能。值得注意的是,仅使用 32 个目标域样本,HEAL 就可以匹配甚至超过使用 1K 目标域样本训练的全镜头 RLVR。