论文
规范顺序问题:当大语言模型是多值关系的不可靠知识库时
The Canonical Order Problem: When Large Language Models Are Unreliable Knowledge Bases for Multi-Valued Relations
摘要
由于大语言模型 (LLM) 在预训练期间获取了大量知识,因此越来越多地用作知识库 (KB)。虽然许多工作专注于提取单个关系三元组,但大多数现实世界的关系是多值的并且需要生成实体集。在本文中,我们研究了大语言模型如何表示和生成多值关系。我们确定了规范顺序问题:大语言模型内部的概率分布根据规范顺序(例如字母顺序或时间顺序)组织许多多值关系。通过机制分析,我们表明大语言模型中的集合生成可以分为三个阶段:(1)候选实体的检索,(2)内部排序,以及(3)下一个元素的选择。因此,当旨在为多值关系生成完整集时,提示构建偏离这种内部规范排序的 KB 会导致 LLM 的可靠性显着降低。