论文

大语言模型 中情境理解的评估

Evaluation of Contextual Understanding in Large Language Models

模型评测评测方法与指标

摘要

大语言模型在多种自然语言处理任务中表现突出,但能否真正理解上下文仍不确定。困惑度、BLEU及表面准确率等传统指标,无法揭示模型提取、整合和推理上下文信息的能力。在问答中,这一缺口尤其重要:模型需要依据上下文知识作答,而不是依靠记忆中的关联。我们提出基于知识图谱的新评测框架,引入知识图谱语义结构相似度S3KG,将结构相似度与语义相似度结合为连续评分,并配套用于分类推理错误的诊断框架。我们在整理的问答基准上与既有指标比较,验证S3KG在衡量模型回答正确性、忠实性及可解释性方面的有效性。