论文

S3KG:用知识图谱结构与语义评测上下文理解

Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework

模型评测上下文与知识上下文工程评测方法与指标

摘要

虽然大型语言模型(LLM)已经取得了卓越的语言能力,但其核心仍然存在一个深刻的问题:这些模型是否真正理解上下文,或者只是在前所未有的规模上擅长模式匹配?大语言模型中的语境理解是指从给定语境中正确提取相关信息、将其整合到连贯的内部表示中并对其进行推理以产生事实一致且基于语境的响应的能力。然而,双语评估研究 (BLEU) 和困惑度等传统方法只是衡量表面水平的表现。这揭示了问答(QA)中的一个关键差距,其中的回答必须基于上下文,而不是简单地记住关联。为了填补这一空白,我们提出了一种基于知识图(KG)的新型评估框架,用于 QA 中的 LLM 上下文理解。其中的核心是 KG 的语义结构相似性 (S3KG),这是一种将结构和语义信号组合成单个分数的混合相似性度量。此外,还开发了一个诊断分析框架来识别和分类三元组级别的推理错误,从而能够对模型故障进行细粒度分析。总的来说,在九个基准中,S3KG 的 F1 收益比最强基线高出7.6,AUROC最高达0.973。

S3KG通过标签对齐知识图谱和三元组分析比较LLM上下文理解。
图1(图注摘要):S3KG通过标签对齐知识图谱和三元组分析比较LLM上下文理解。