论文

超越问题:评估 LLM 的知识表达

Beyond Questions: Evaluating LLM's Knowledge Expression

模型评测基准与评测资源

摘要

大语言模型 (LLM) 中的参数知识是其成功的基石,但人们对其了解仍知之甚少。现有的知识基准通常依赖于预定义的问题(例如,“M.L. King 的出生日期是什么?”),仅评估基准设计者明确选择查询的知识,这是一个有问题的可用性偏差。在本文中,我们介绍了开放知识评估,这是 LLM 知识表达基准测试的新范式。它不会提出狭隘的问题,而是根据模型选择的知识来评估模型,以响应开放式的启发提示(例如,“告诉我你所知道的有关 M.L. King 的一切”)。这将焦点从预定义的答案检索转移到表征自然表达的知识模型。我们用 BeQu(Beyond Questions)来实例化这个范式,这是一个由 10,000 个实体组成的基准,与用于语句验证的参考语料库配对。使用 BeQu,我们评估了广泛的语言模型,并分析了推理工作、模型规模、提示格式和知识领域的影响。数据和排行榜可在这项工作的 GitHub 存储库和基准测试网站上找到。