论文
交叉熵博弈与Frost Training
Cross-Entropy Games and Frost Training
摘要
我们提出 Frost Training,一种改进基于蒙特卡洛的策略优化的方法,面向一大类称为交叉熵博弈(Cross-Entropy Games)的 LLM-as-a-judge 任务。其关键思想是利用奖励函数在嵌入空间中的梯度。该信号被用于 Greedy Coordinate Gradient(GCG)越狱技术;我们首次证明它也可以用来提升模型训练。我们使用针对最大似然填充(infilling)的 GRPO 训练来验证该方法。Frost Training 提升了模型生成高分输出的能力,在 best-of-k 设置下达到更高的最大分数,并且速度更快。