论文
开放式文本多维评价的维度间依赖
Inter-dimension Dependence for Multi-Dimensional Evaluation of Open-Ended Text
摘要
LLM-as-a-judge 方法广泛用于评估生成的开放式文本的质量。这种评估通常是多维的,因为文本中的错误模式对于不同的维度可能是不同的。因此,可靠的LLM评委应该独立评估每个目标维度。为了量化LLM在评估目标维度时判断对非目标维度的依赖程度,即维度间依赖,我们提出了CorrGap。为了衡量这一点,CorrGap 使用不同文本组中 LLM 预测分数和 真值 分数之间的相关性差异。使用 CorrGap,我们表明在开放式文本评估任务中,LLM 法官普遍存在维度间依赖。为了减轻维度间的依赖性,我们提出了 DimCheck,一种以逐步方式迭代地从 LLM 法官生成的 COT 中删除不相关证据的方法。我们证明 DimCheck 减轻了维度间依赖性,并在三个 LLM 和四个任务中优于强大的基线。我们还表明,经过训练的较小 LLM 可以在 DimCheck 中近似较大的 LLM,并且推理成本要低得多。