论文

稳健的共形共识:具有共形预测的多智能体 LLM-as-a-Judge 区间评估

Robust Conformal Consensus: Multi-Agent LLM-as-a-Judge Interval Evaluation with Conformal Prediction

模型评测评测方法与指标

摘要

LLM-as-a-Judge 已成为评估自然语言生成的有前途的范例。然而,与此类评估相关的不确定性在很大程度上仍未得到探索,这限制了它们在实际应用中的可靠性。尽管保形预测为不确定性量化提供了原则框架,但现有方法通常将其应用于单个 LLM 判断,忽略了使用不同 LLM 评估器引入的可变性。在这项工作中,我们提出了一个用于多智能体 LLM-as-a-Judge 评估的稳健的不确定性估计框架。我们的方法为来自多个 LLM 的基于 LLM 的分数构建保形预测区间。通过考虑不同 LLM 判断的区间,我们获得了更稳定、更可靠的不确定性估计。大量的实验表明,我们的方法可以产生具有覆盖保证的有效预测区间,并且跨多个法官的基于区间的聚合可以带来更稳定的评估结果。