论文
通过约束最大似然估计进行稳健的 LLM 性能认证
Robust LLM Performance Certification via Constrained Maximum Likelihood Estimation
摘要
严格估计大语言模型(LLM)故障率的能力是其安全部署的先决条件。然而,目前,从业者经常面临昂贵的人工金标准和潜在严重偏见的自动注释方案(例如“LLM-as-a-Judge”标签)之间的权衡。在本文中,我们提出了一种基于约束最大似然估计(MLE)的新的、实用的、有效的 LLM 故障率估计方法。我们的方法集成了三个不同的信号源:(i) 一个小型的、高质量的人工标记校准集,(ii) 一个 LLM 法官注释的大型语料库,最重要的是,(iii) 通过从法官表现统计数据的已知范围派生的特定领域约束来获得额外的辅助信息。我们通过全面的实证研究来验证我们的方法,并将其与预测驱动推理 (PPI) 等最先进的基线进行比较。在不同的实验方案中——涵盖不同的判断精度、校准集大小和 LLM 失败率——我们的约束 MLE 始终提供比现有方法更准确和更低方差的估计。通过超越自动化法官的“黑匣子”使用,转向灵活的框架,我们提供了一条有原则的、可解释的和可扩展的 LLM 故障率认证途径。