论文

LUMOS参数知识溯源

LUMOS: Tracing Parametric Knowledge from Training Data to Behavioral Outputs in LLMs

模型评测模型行为与机制分析

摘要

当前对LLM参数知识的分析大多以输出为中心,在不核实模型实际训练内容的情况下断言模型知道什么。这使"正确回答反映真实泛化还是死记"这类基本问题停留在猜测。我们提出LUMOS,一个沿训练数据暴露到行为输出的因果链追溯知识的诊断框架,利用训练语料完全透明的OLMo 2。以已验证暴露为基础,我们发现模型对罕见事实的内部编码具有高可分性(84%)却难以在行为上表达(54%),且该检索差距随规模缩小。当被要求对自身答案自我反思时,模型在已训练内容上表现可靠(83%),在未见内容上跌至随机基线水平(49%)。这种崩塌即使思维链提示也无法挽回——后者只会抬高置信信号而不改善校准。这些发现表明把训练数据轴纳入LLM评测能把思辨诊断变为可验证主张;我们主张该轴应成为LLM知识评估的标准组成部分。