论文

任务分解是否改善了自动 NLG 评估?

Does task decomposition improve automatic NLG evaluation?

模型评测模型行为与机制分析

摘要

LLM-as-a-judge (LLMaJ) 框架已成为廉价、可重复、无参考的自然语言生成 (NLG) 评估的一种有前途的解决方案。先前的工作旨在通过将评估任务分解为更简单的子任务来改进 LLMaJ。在这项工作中,我们系统地比较了在多个 NLG 数据集上使用和不使用分解的 LLMaJ 方法。我们没有发现任何证据表明使用任务分解的 LLMaJ 会比不使用分解的公平基线带来性能提升。相反,我们发现之前报道的基于分解的 LLMaJ 的性能提升源于使用人类标签作为训练数据,而不是任务分解本身。此外,我们发现,当人工标签可用时,不使用任务分解的 LLMaJ 的性能可以与人工注释者相媲美。