论文
不可验证生成中的评审模型与生成模型协同演化
Co-Evolving Actor-Conditioned Critics for Non-Verifiable Generation
摘要
缺少确定性验证器的生成任务可用自然语言批评提供超出标量奖励的监督。评审模型反馈初始回答,生成模型据此修订,但最终质量不等于反馈有用:生成模型可能不采纳反馈也能进步,或无法执行正确反馈。本文把批评建模为依赖目标生成模型能力的修订指导。TAIScore联合检查指令、初答、批评及修订,评估反馈是否针对真实弱点、是否被采纳,以及目标方面是否改善。用该奖励以GRPO训练适合目标生成模型的评审器,再用批评引导的修订为生成模型构造DPO偏好对,形成相互演化循环。实验显示,TAIScore训练的8B评审模型优于零样本120B评审模型,以及仅用结果或仅用批评奖励的模型;共同演化进一步改善表现,支持反馈随生成能力变化而调整。