论文

超越 LLM-as-a-Judge:多语言生成文本评估的确定性指标

Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation

模型评测评测方法与指标

摘要

虽然 大语言模型 (LLM) 越来越多地被用作评估生成文本的自动法官,但它们的输出通常成本高昂,并且对提示设计、语言和聚合策略高度敏感,严重限制了可重复性。为了应对这些挑战,我们提出 \textbf{\textit{OmniScore}},这是一系列使用小尺寸($<$1B)参数模型开发的互补的确定性学习指标。 OmniScore 近似 LLM 判断行为,同时保留传统基于模型的评分的低延迟和一致性。我们训练了模型大规模综合监督($\sim$564k 个实例,\textbf{107 种语言}),并使用 8,617 个手动注释实例进行评估。 OmniScore 系列支持跨各种设置的可靠、多维评分,包括基于参考、基于源和混合评估。我们通过 \textbf{6 种语言}的问答 (QA)、翻译和摘要来评估这些模型。我们的结果表明,轻量级、确定性学习指标为前沿 LLM 提供了高度实用且可扩展的替代方案。我们的模型和数据集可以在 https://huggingface.co/collections/QCRI/omniscore 找到