论文
LLMpedia:大规模实现 LLM 百科全书知识的透明框架
LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale
摘要
MMLU 等基准表明旗舰语言模型的真实性饱和度达到 90% 以上。 \emph{LLMpedia} 显示这张图片不完整。我们完全从三个模型系列的参数记忆中具体化了 ${\sim}$130 万篇百科全书文章,然后审核针对维基百科和精选网络证据的每项声明。对于 \texttt{gpt-5-mini},维基百科涵盖的主题的可验证真实率为 68.4\% - 比 MMLU 低 21\,pp - 并且差距是由 \emph{不可验证性} (30.5\%) 驱动的,而不是反驳 (1.2\%)。除维基百科外,根据精选网络证据审核的前沿文章达到 57.6\%;维基百科仅涵盖 56.7% 的模型主题,三个模型系列仅在 7.3% 的主题选择中重叠。在一项受 Grokipedia 先前分析启发的检索陷阱基准中,LLMpedia 更加真实,其文本相似度约为 Wikipedia 的一半。每一条提示、每一篇文章、每一条判决都会被发布。数据、代码、接口:https://llmpedia.net。