论文
参数化知识图存储器中的存储-检索差距
A Storage-Retrieval Gap in Parametric Knowledge Graph Memory
摘要
图检索增强生成在查询时将检索到的子图放入模型的上下文窗口中,支付重复的词元成本并在每次调用时公开源数据。我们研究了一种替代方案:将知识图离线编译到一组 LoRA 适配器中,每个实体一个,充当参数知识层,通过注入权重而不是文本进行查询,查询时间上下文成本为零。在 MetaQA 数据集上,我们发现子图训练的适配器编码了上下文无关的事实知识,可以推广到未见过的问题:在单值关系上,适配器比几乎盲闭书的基本模型获得 $+0.243$ 精确匹配分数($0.007$),并且只有正确的适配器才能恢复这些知识(与基本模型相比,Oracle 差距为 $+0.283$)。然而,存储的知识无法通过相似性来恢复:给定一个没有子图的查询,基于嵌入的几何检索和权重空间几何检索都会偶然执行,因为语义相邻实体的适配器不包含答案 - 知识存储在本地并且不会传输。权重几何与子图语义相关($ρ= +0.329$),但与功能可检索性无关。我们根据图检索增强生成来量化字节和上下文词元成本,并讨论部署影响。我们的结果表明,参数化知识图存储器对于存储知识是可行的,并确定通过语义相似性以外的机制选择和组合正确的适配器作为中心开放问题 - 激发学习的、查询条件组合机制。