论文

群熵控制策略优化

Group Entropy-Controlled Policy Optimization

模型训练强化学习

摘要

熵控制已成为大语言模型(LLM)强化学习(RL)的有效工具,有助于平衡对齐过程中的探索与利用权衡。这种强化学习范式通常在异构任务的混合上进行,这会在相同的策略下产生不同的熵状态,使得全局或 词元级 熵调节不足以满足相应的异构探索需求。这种异质性进一步使得 GRPO 式的标准化优势产生依赖于熵的偏差,使得提示组之间的优势信号在统计上不具有可比性。为了解决这个问题,我们提出了组熵控制策略优化(GEPO),这是 GRPO 的轻量级扩展,它使用组熵,根据现有分组样本进行估计,以执行熵条件不对称优势塑造。 GEPO 削弱了低熵组中的积极优势以减少过度开发,并削弱了高熵组中的消极优势以保留探索,并采用从历史熵统计中得出的自适应阈值。对跨越数学、物理、科学、代码生成和指令跟踪等 13 个基准的两个基本模型进行的广泛实验表明,GEPO 始终优于 GRPO 和最近的熵控制方法,提供平衡的跨任务改进,同时在整个训练过程中保持特定于任务的探索水平。