论文

用于评估开放式生成的两级元标准:GAMUT,事实完整性的基准

Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness

模型评测评测方法与指标

摘要

基于量规的开放式生成评估面临着表现力和可靠性之间的根本张力。编写忠实的标题需要表达良好答案的空间结构:可接受的选项的开放式集合、有序的过程以及事实的相对重要性。使用评分标准进行评分要求评委始终如一地评分,而评委在平面、二元检查上比在丰富的结构上更可靠。我们通过两级元标题框架解决了这种紧张关系。结构化元标准在创作时捕获评分标准,固定的机械规则将其编译成二进制、机器可评分检查的平面清单,LLM 法官在评估时可靠地评分。我们将该框架实例化为 Gamut(多模态事实性的扎根评估),这是长格式生成中事实完整性的基准。 Gamut 包含 1,813 个问题,这些问题基于 10 个不同领域的真实可穿戴图像,每个问题都配有由专家人类注释者验证的有证据支持的标题。通过评估 14 个前沿和开放权重模型,我们发现 Gamut 确实具有挑战性(Gemini 3.1 Pro 的最佳得分为 58.7%),具有高度辨别力,并且对判断的选择具有鲁棒性。