论文
自动裁判的两类错误如何影响不确定性评测
A Tale of Two Error Categories: Exploring Concealed Trade-Offs in the Errors of Automated Judges in Evaluation of Uncertainty Quantifiers
摘要
LLM在 NLG 应用中的广泛采用,凸显了为用户提供避免错误和幻觉的方法的重要性。不确定性量化有望填补这一空白;具有低不确定性(高置信度),作为正确性的代理,允许用户进行选择性(例如,拒绝低置信度、可能不正确的响应)。然后,置信度和正确性之间的相关性可以作为评估不确定性量词 (UQ) 的有用标准。但在 NLG 中,不同的反应足以产生提示,获得可靠的正确性判断并不简单,尤其是在没有人工干预的情况下。自动判断中的错误几乎是不可避免的,并且已知会降低评估方案的可靠性(Santilli 等人,2025 年;Ielanskyi 等人,2025 年)。在对已发表作品的荟萃分析中,我们表明自动判断是当前的常态。此外,自动判断很少经过人类判断的验证,而他们自动化的昆士兰大学评估的验证则更加罕见。通过问答实验,使用 4 个LLM、人工和自动判断以及 7 个流行的 UQ,我们发现 i) 裁判的表现只能粗略地预测其错误对 UQ 评估可靠性的观察到的影响,并且 ii) 判断错误往往最容易歪曲信息丰富的 UQ。我们将这些观察结果与置信度和判断错误类别之间的相关模式联系起来。