论文
RoPoLL:LLM裁判的鲁棒小组
RoPoLL: Robust Panel of LLM Judges
摘要
LLM 评审团是由 LLM 评估员 (PoLL) 组成的报告共识分数的小组,已成为单一法官 LLM 评估的实用替代方案,但其统计行为仍然知之甚少。我们在 Huber 污染模型下将 LLM 陪审团形式化,并表明,无论陪审团规模如何,只要单个法官以有偏见的、LLM 典型的方式(模式崩溃、阿谀奉承、安全拒绝)失败,PoLL 在任何积极污染下都会产生无限的偏见。将陪审团共识框架为经典的稳健均值估计,我们提出了 RoPoLL(大语言模型作为法官的稳健面板),它保留了 PoLL 面板,但用稳健的均值估计器替换了聚合函数,并用几何中值(GM)实例化:无需调整,最佳有限样本分解点为 1/2。有限样本误差界和匹配的信息论极小极大下界在参数率 sigma*sqrt(d/N) 上一致,但在分解下限上存在 sqrt(d) 因子的差异,这是多项式时间 RoPoLL 相对于棘手的 Tukey 半空间中值所付出的统计计算差距。在 13 个开放权重法官 (4B-675B)、三个奖励模型基准和四个高达 50% 的腐败制度中,RoPoLL 在每种有偏见的腐败类型上都优于 PoLL:在匹配计算的跨维度攻击上占主导地位约 19%,在重尾拜占庭对手上占主导地位。由 3 名法官组成的 RoPoLL 委员会在 30% 双峰随机损坏的情况下,在 HelpSteer-2 上以 38B 击败 Mistral-Large-3 (675B) 1.31 倍,在更高的准确度下具有 18 倍的参数优势; Noisy-GT 控制确认溢价是针对有偏差的污染而不是良性的不精确而支付的。
