论文
LLM裁判评测实体一致性的可靠性
Reliability of LLM Judges for Evaluating Entity Alignment
摘要
实体对齐(EA)识别不同知识图谱中的等价实体,是知识库整合和本体合并的重要环节。大规模评测EA系统需要成本高昂的专家标注,难以覆盖多种领域。使用LLM作裁判可能提供可扩展的替代方式,但其对EA等结构化预测任务的可靠性仍缺少研究。我们首次在三个前沿模型、三个数据集和四个EA系统间开展系统基准研究,采用扰动偏差诊断、覆盖全部数据集—裁判—提示组合的元评测,以及反事实标签翻转测试。我们发现“锚定偏差”:当被评测系统的决策标签可见时,裁判甚至会反向区分正确和错误。暴露标签会因果性地降低裁判的区分能力,J-ROC-AUC降至0.12—0.87;隐藏标签后,在名称容易区分的数据集上恢复到接近上限的0.93—1.00,在生物医学实体对上也显著恢复至0.93—0.95。反事实实验确认了因果关系,FSR为53—99%,并揭示一个前沿模型悖论:更强的裁判对标签更敏感,而非更不敏感。两位标注者的盲法人工评测包含102对实体,Cohen's kappa为0.902,直接证实了这一机制。我们发布首个生物医学EA基准MeSH-SNOMED CT,包含15,000对实体,以及可复现的LLM裁判可靠性审计框架。代码和数据见https://github.com/vaibhavalakshmiravideshik/llm-as-a-judge-entity-alignment。
