论文
LLMPEDIA:浏览、验证和比较 LLM 的参数化百科知识
LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs
摘要
旗舰语言模型在 MMLU(Hendrycks 等人,2021)等基准测试中似乎已经饱和,得分超过 90%,但基准测试仅测试实验者想问的问题,即固定问题集的可用性偏差。 LLMPEDIA 使这种偏差变得可测量和可浏览。我们从三个模型系列的参数内存(GPT-5-mini、DeepSeek-V3.2、Llama-3.3-70B)中递归地具体化了约 130 万篇文章,无需检索,然后根据维基百科和策划的网络堆栈审核原子声明的分层样本,对每个支持、反驳或不足的声明进行着色(Saeed 和 Razniewski,2026)。在统一随机样本中,真实率为 68.4% - 比 MMLU 低 21 个百分点以上 - 30.5% 的声明不足:没有基准探针的断言,世界上最大的百科全书无法裁决 - 长尾知识或似是而非的幻觉,证据无法判断 - 将 GPTKB 为三元组建立的覆盖差距扩展到自由文本(Hu 等人,2025)。由此产生的实时、开放的百科全书让访问者可以通过五个一键式视图一次检查这一前沿的一个主张 - 链接遍历探索、主张级别的事实性、跨模型和政治人物比较以及引导式主题深入研究 - 每个页面、主张和判决均位于稳定的 URL。 LLMPEDIA 现已上线 https://llmpedia.net