论文
通过 DynamicRubric 共同进化 LLM 评估器和策略
Co-Evolving LLM Evaluators and Policies via DynamicRubric
摘要
具有评估器反馈 同策略 诱导样本的 后训练 作为改进 大语言模型 的主要机制。随着政策的改进,这些抽样响应的质量变得接近。这些接近的候选人给政策优化带来了瓶颈:相对评估者分数差距的缩小导致政策监督薄弱或误导。我们从理论上描述了为什么这些差距很重要,通过概率分配视图,表明将概率质量从一种响应转移到另一种响应的方向增益正是它们之间的评估者分数差距。这将相对分数差距识别为指导更新的策略优化信号。受这种观点的启发,我们提出了 DynamicRubric,一种响应集条件评估器-策略协同进化框架,它为每个候选集生成加权二进制标题项,并将结果判断聚合为响应级别分数。在我们使用 8B 主干的实验中,DynamicRubric 提高了评估器的性能,并提供比使用 70B 奖励模型或 235B 静态 rubric 生成器的基线更强的策略监督。 DynamicRubric 优化策略还显示出在可验证推理和编码任务方面的收益。 DynamicRubric优化模型全面部署在微信搜索的AI应答场景中,服务于每天数千万个请求的所有在线流量,并改善了关键的在线指标。这些结果提出了评估者引导的 后训练 原则:评估者应该随着他们监督的政策而发展。