论文

策略分裂:通过双模熵正则化激励 LLM 强化中的双模探索

Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

模型训练强化学习

摘要

为了鼓励在不影响准确性的情况下对 大语言模型 (LLM) 的强化学习 (RL) 进行多样化探索,我们提出了策略分割,这是一种新颖的范式,可通过高熵提示将策略分为正常模式和高熵模式。在共享模型参数的同时,这两种模式进行针对不同目标定制的协作双模式熵正则化。具体来说,正常模式针对任务正确性进行优化,而高熵模式则包含对探索的偏好,并且两种模式协同学习。大量实验表明,在一般任务和创造性任务中,我们的方法在各种模型大小上始终优于已建立的熵引导强化学习基线。进一步的分析表明,策略分裂有利于双模式探索,其中高熵模式产生与正常模式不同的行为模式,提供独特的学习信号。