论文

LLM裁判评测实体一致性的可靠性

Reliability of LLM Judges for Evaluating Entity Alignment

模型评测上下文与知识知识图谱评测方法与指标鲁棒性、公平性与可信度评测

摘要

实体对齐(EA)识别不同知识图谱中的等价实体,是知识库整合和本体合并的重要环节。大规模评测EA系统需要成本高昂的专家标注,难以覆盖多种领域。使用LLM作裁判可能提供可扩展的替代方式,但其对EA等结构化预测任务的可靠性仍缺少研究。我们首次在三个前沿模型、三个数据集和四个EA系统间开展系统基准研究,采用扰动偏差诊断、覆盖全部数据集—裁判—提示组合的元评测,以及反事实标签翻转测试。我们发现“锚定偏差”:当被评测系统的决策标签可见时,裁判甚至会反向区分正确和错误。暴露标签会因果性地降低裁判的区分能力,J-ROC-AUC降至0.12—0.87;隐藏标签后,在名称容易区分的数据集上恢复到接近上限的0.93—1.00,在生物医学实体对上也显著恢复至0.93—0.95。反事实实验确认了因果关系,FSR为53—99%,并揭示一个前沿模型悖论:更强的裁判对标签更敏感,而非更不敏感。两位标注者的盲法人工评测包含102对实体,Cohen's kappa为0.902,直接证实了这一机制。我们发布首个生物医学EA基准MeSH-SNOMED CT,包含15,000对实体,以及可复现的LLM裁判可靠性审计框架。代码和数据见https://github.com/vaibhavalakshmiravideshik/llm-as-a-judge-entity-alignment。

LLM裁判评测实体一致性的可靠性:论文原图
图 1:LLM作为实体对齐的裁判评估,使用 D-W-15K(DBpedia-Wikidata)进行说明。这两个 KG 实体共享“速度与激情”的名称和同一位导演,但指代的内容不同:实体 A (DBpedia) 是 2001 年的电影;实体 A (DBpedia) 是 2001 年的电影;实体 B(维基数据)是整个特许经营系列。正确的对齐标签是“不匹配”。黑色路径(LLM作为判断):EA系统正确预测Non-Match; LLM 裁判对这一决定的评分为 3/10,这意味着它认为不匹配是不合理的——基于共同的姓名和董事,而不是根据证据进行推理。红色路径(LLM 作为预测器):当实体对在没有任何系统标签的情况下直接发送到 LLM 时,它会以 8/10 的置信度预测匹配 — 再次锚定表面名称相似性。