论文
IRIS:来自 Frozen LLM 的可重用身份表示,用于实体对齐
IRIS: Reusable Identity Representations from Frozen LLMs for Entity Alignment
摘要
实体对齐 (EA) 识别知识图 (KG) 中引用同一现实世界对象的实体。传统的 EA 方法主要利用显式图结构和文本字段,这些结构通常无法提供足够的语义理解来识别异构描述下的同一实体并将其与语义相似的实体区分开来。尽管 大语言模型 (LLM) 提供了更深入的实体理解,但现有的基于 LLM 的 EA 方法主要将此功能用于辅助生成或候选条件决策。因此,这种理解并没有被提炼成稳定且可直接比较的身份空间,使得对齐与特定的知识图谱对或候选集相关联,并且随着匹配上下文的变化需要重复处理。为了解决这些限制,我们提出了 IRIS(来自内部状态的身份表示),这是一个 无需训练 框架,它为每个实体构建一个类似虹膜的签名,编码其独特且稳定的身份特征。 IRIS 通过从冻结的 LLM 中引出面向身份的上下文表示来导出这些签名,从而形成一个共享空间,其中每个实体都被编码一次,并且可以通过直接相似性比较在不同的 KG 之间进行对齐,而无需对依赖的表示构造或候选 LLM 推理。在四个已建立的 EA 基准和两个冻结的 LLM 主干上,最佳 IRIS 变体在 D-Y-15K V2、DBP-WIKI、ICEWS-WIKI 和 ICEWS-YAGO 上分别获得了 100.00、99.38、98.31 和 97.99 的 Hits@1 分数。