论文

使用 LLM 法官增强人工评估:您需要多少人工评审?

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用作人工智能系统的自动评估器,包括在高风险应用中。在此角色中,LLM 用于生成有关模型输出的质量、适当性甚至安全性的判断。这种方法是受到实际限制的推动。专家的人工评级成本高昂且难以扩展,而 LLM 评级可以以低成本快速生成。然而,当前部署 LLM 评估器的方法是临时的,通常仅限于报告人类和 LLM 法官之间的一致性指标,作为替代人类评级的理由,并且缺乏研究设计的正式基础。本文(1)将LLM法官的角色从替代性转变为辅助性,(2)将LLM作为法官的范式制定为通过两阶段抽样设计增强人类评估的一种,其中在第一阶段对所有观察结果进行LLM评估,在第二阶段对子样本进行部分观察。我们建议使用缺失数据文献中的双鲁棒估计器,该估计器利用了预测模型的鲁棒性,因为缺失模型是通过设计已知的。使用该估计量的渐近方差,我们提出了如何确定人类和 LLM 评级的样本大小以实现目标功效水平。我们还表明,通过为 LLM 评级的可预测性不高的评估类型分配更多的人类评级,可以有效地设计研究。据我们所知,关于验证基准时应保留多少人工监督的指导很少。