论文

KnowledgeBerg:评估大语言模型的系统性知识覆盖与组合推理

KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models

模型评测基准与评测资源

摘要

许多现实问题看似简单,实则隐含地要求两种能力:(i) 对一个有界知识论域的系统性覆盖,以及 (ii) 在该论域上的组合式集合推理,我们将这种现象称为“冰山一角”(the tip of the iceberg)。我们通过两个正交维度将这一挑战形式化:知识宽度(所需论域的基数)与推理深度(组合式集合运算的次数)。我们提出KnowledgeBerg,一个包含4,800道选择题的基准,题目源自横跨10个领域与17种语言的1,183个枚举种子,其论域均锚定于权威来源以保证可复现性。具有代表性的开源LLM表现出严重局限,在论域枚举上仅取得5.26-36.88的F1,在基于知识的推理上仅取得16.00-44.19的准确率。诊断分析揭示了三个失败阶段:完整性(知识缺失)、意识(未能识别需求)与应用(推理执行错误)。这一模式在不同语言与模型规模上持续存在。尽管测试时计算与检索增强带来了可衡量的收益——分别最高4.35分与3.78分——差距仍然巨大,暴露出当前LLM在组织结构化知识与在有限论域上执行组合推理方面的局限。数据集发布于 https://huggingface.co/datasets/2npc/KnowledgeBerg