论文

J-Zero:统一挑战者--求解者--从零数据判断自我进化

J-Zero: Unified Challenger--Solver--Judge Self-Evolution from Zero Data

模型训练奖励建模与过程监督

摘要

自我进化的语言模型最近已成为通向超级智能的一条有希望的道路,其优点是降低人类监督的成本。尽管在可验证领域已经取得了相当大的进展,但在不可验证领域的自我进化仍然很少被探索。我们提出了法官从零数据(J-Zero)的共同适应,这是一个统一的挑战者-解决者-法官自我进化框架,支持跨两个领域的自我改进。挑战者和解决者通过对抗性互动共同进化:挑战者生成越来越困难的任务,而解决者则学习对这些任务产生更高质量的响应。与此同时,法官使用偏好对进行共同适应,这些偏好对的顺序是根据每个响应的产生方式预先知道的,即解决者的答案相对于挑战者的答案,以及解决者的分解和重组答案相对于其一次性答案,而不是来自法官自己的分数。 J-Zero 在可验证领域平均优于基线 4.2 点,在不可验证领域平均优于基线 8.0 点,并且通过至少十次迭代持续改进,而基线在两次迭代后就会下降。进一步的分析表明,法官的共同适应是这种持续改进的关键驱动力。