论文

NormasTCU --- 巴西葡萄牙语 IR 数据集和 LLM 作为相关性评估法官的评估

NormasTCU --- A Brazilian Portuguese IR Dataset and an Evaluation of LLM-as-a-Judge for Relevance Assessment

模型评测基准与评测资源

摘要

葡萄牙信息检索 (IR) 缺乏公共数据集,并且对专业馆藏的相关性评估仍然成本高昂。虽然 大语言模型 (LLM) 越来越多地支持相关性评估,但它们在非英语专业领域的可靠性仍不清楚。我们引入了 NormasTCU (https://huggingface.co/datasets/LeandroRibeiro/NormasTCU),这是一个巴西葡萄牙语 IR 数据集,包含 14,469 个法律文档、46 个查询和 812 个查询文档对的 3,048 个人工判断。使用 NormasTCU,我们通过使用两种提示技术提示三个模型来对这些配对进行评分,从而评估 LLM 作为相关性评估的法官。然后,我们比较了源自 LLM 生成的 15 个 IR 系统和人类参考 qrel 的排名。 LLM 始终表现出正评分偏差(平均绝对误差:0-2 等级上的 0.46--0.66)。此外,与人类判断的配对水平一致性仅达到中等至中等水平,Cohen 的 kappa 范围为 0.32 至 0.53。尽管存在这种偏差,LLM 生成的判断通常会对 nDCG@10 和 MRR 产生高度相似的系统排名(观察到 Kendall 的 tau 大于或等于 0.90,尽管自举置信区间并不总是保持在该阈值之上),但对于 P@10 和 R@10 的可靠性较低。值得注意的是,基于 LLM 的排名有时与参考排名的相关性比单个人类注释的相关性更强。作为实际意义,我们的结果表明,当使用 nDCG 或 MRR(排名感知指标)进行评估时,LLM 可以有效支持专业葡萄牙语料库中的可扩展相关性评估,但在依赖精度或召回率时应避免使用它们。