论文

ER-CE:为可验证示范加入熵正则

Entropy Regularization: A Free Correction to Cross-Entropy for Verified Demonstrations

模型训练监督微调与指令调优

摘要

大型语言模型通常使用交叉熵(CE)在专家演示上进行后训练,即使下游目标不是模仿演示的解决方案,而是产生验证者接受的任何输出。这种不匹配出现在具有多个正确解决方案的可验证领域,例如数学推理和代码生成,其中训练数据可能只包含每个问题的一个专家解决方案。我们表明,最小化交叉熵可能与最小化验证者风险不一致;两种策略可以为观察到的演示分配相同的可能性,同时对不正确的输出设置不同的概率质量。这是通过学习理论反例形式化的,其中 CE 最小化选择次优策略。我们发现,约束所学策略的支持集可以通过防止概率质量扩散到不受支持的输出来解决这个问题。由于支持集大小是不可微的并且计算上难以处理,因此我们提出熵正则化交叉熵(ER-CE),使用词元级香农熵作为易于处理的代理。最后,在数学推理和代码生成基准测试中,我们发现熵正则化训练始终比标准交叉熵提高通过验证器的准确率。我们的结果确定了可验证任务中基于模仿的后期训练的简单失败模式,并提供了一个更符合产生正确输出的实际目标。