论文
证明:分析大型语言模型中对象级事实的可靠性
PROOF: Profiling Reliability of Object-Level Facts in Large Language Models
摘要
总体事实性得分隐藏了语言模型成功的地方、它混淆了哪些关系,以及答案是否能够在问题或解码器的无害更改中幸存下来。我们引入了 PROOF,这是一种面向概要文件的基准,用于指令调整的语言模型中的事实覆盖率。 PROOF 将冻结的维基数据快照转换为 18,486 个英语多项选择题,这些问题基于 11,779 个语义事实、101 个类别、392 个属性和 14 个领域。每个问题都有一个明确的“我不知道”选项、一个“没有正确选项”控制和九个受控表述; 1,849 个问题属于无正确选项陷阱。我们在 166,374 个提示上评估了 18 个开放权重模型部署,并分别扰乱固定 10% 子集上的解码。基本事实准确性范围从 6.58% 到 57.59%(机会:8.64%),但每个模型在各个领域的分布有 19.3-36.4 个百分点。配对事实揭示了方向相关的检索,通常有利于主语到客体的查询,而一个模型的模式则相反。我们发现在精确层调整后没有一致的时间惩罚。中性措辞使准确度改变多达 26.5 个百分点,而对抗性表述则破坏了最初正确答案的 79.4%。直接切换到注入的错误标签的比例从 0.04% 到 27.5% 不等,表明准确性损失和提示跟踪是明显不同的。选定的词元置信度通常表明严重过度自信,解码器扰动使准确度提高了 15.7 个百分点,域配置文件提高了 16.8 个百分点。因此,PROOF 将事实覆盖率衡量为结构化的、具有干预意识的概况,而不是关于模型“相信”什么的单一主张。