论文
JudgePanel:通过自适应多奖励强化学习实现小组审议的紧凑裁判模型
JudgePanel: A Compact Judge with Panel Deliberation via Adaptive Multi-Reward Reinforcement Learning
摘要
LLM作为法官范式已成为人类评估的可扩展替代方案。然而,单模型法官受到其固有模型偏差的限制,而通过不同的审议来缓解这一问题的多智能体评估协议在推理时的成本过高。为此,我们提出 \textbf{\modelname},它配备了具有多代理 \underline{Panel} 审议能力的紧凑 \underline{Judge} 模型。具体来说,我们首先根据一组强大的评估者的小组审议痕迹进行训练,捕捉讨论、分歧和解决的结构化模式。为了进一步提高 SFT 之外的判断质量,我们引入了 \textit{AdaReward},这是一种自适应多奖励 RL 算法,该算法在 RL 训练期间随着不同目标以不同速率饱和而动态重新平衡奖励分量权重。对于实际部署,我们进一步设计了一个轻量级领域专业化模块,用于快速适应具有数百个标记样本的新评估领域。因此,(i) \textit{Novel}:第一个以单模型推理成本为单个紧凑法官配备多智能体小组审议能力的框架; (ii) \textit{有效\&可靠}:具有 14B 主干的 JudgePanel 在四个评估基准上优于法官专业模型高达 70B,表现出很强的位置一致性,并快速专门化到具有数百个样本的新领域。
