论文

停止和路由 LLM 法官小组

Stopping and Routing LLM Judge Panels

模型评测评测方法与指标

摘要

LLM 评估管道通常有许多候选法官:一般 LLM 作为法官提示、奖励模型、安全分类器、置信度变体和特定于任务的验证器。部署问题不仅在于哪个法官最好,还在于应该召集哪些法官、针对哪些示例以及何时停止小组建设。我们将法官小组设计制定为角色条件分配问题。该方法从一个小的标记审计集、声明的切片和判断成本中估计目标相关角色:副本不添加条件信息,补充改进了全局小组,专家仅在切片上提供帮助。这些角色会产生一个策略:删除副本、全局添加补充、有条件地路由专家,以及在验证增益低于阈值时停止。在推理、代码、安全性、偏好、奖励模型、总结和数学审计方面,该方法与单一法官、平板、匹配多样性启发式、全调用堆叠、可靠性陪审团和节俭级联进行比较。结果是一个供法官调用的制度图:在可部署的切片上路由专家,在饱和的验证者制度中停止,当风险收益值得成本时保留广泛的集合,并忽略有条件的副本。输出是下一个评估批次的可重用、可审计的调用计划。