论文
超越共识:多智能体 LLM 主观评价法官中的向下偏差和角色不对称
Beyond Consensus: Downward Bias and Role Asymmetry in Multi-Agent LLM Judges for Subjective Evaluation
摘要
多智能体辩论(MAD)已被广泛采用,通过促使多个智能体协商并达成共识来改进基于 LLM 的评估。然而,对于基于主观评分的评分,智能体间的一致性并不能保证与人类判断的一致性。在本文中,我们将单法官基线与基于共识的 MAD 协议在主观评估任务上进行比较,并设计了三种消融来隔离角色提示、多轮交互和显式分数共享的影响。对六个 LLM 的评估表明,单法官基线在六个法官模型中平均实现了最强的人类对齐,而 MAD 显示了两项任务的人类对齐退化。我们的消融表明,这种绩效下降主要源于不对称的角色提示,而不是交互本身。具体来说,指定严格的法官角色会引入系统性的向下偏差,而共识过程无法纠正这种偏差。核心发现是,这种偏差反映了严格立场的主导地位超出了平均水平:共识分数远远超出了独立严格和宽松条件的算术中点,而不是对它们进行平均。消除角色不对称(Symmetric MAD)在很大程度上恢复了基线表现,而掩盖同伴分数则平均扩大了智能体之间的分歧,并恶化了平均人类一致性。这些发现表明,多智能体共识可以以牺牲真正的人类一致性为代价来强制达成人为协议,揭示了共识式、角色专用的 MAD 协议在主观评分方面的结构性限制。