论文

无知识语言模型:抑制基于证据的语言建模的参数回忆

Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling

模型训练预训练

摘要

语言模型在其参数中编码大量事实知识,当这些知识过时、不完整或与所提供的上下文不一致时,可能会导致不可靠的行为。在这项工作中,我们研究修改预训练信号是否可以系统地将模型从参数回忆转向基于证据的推理。我们引入知识-“Less”语言模型(KLLM),这是 LLM 的一种根本不同的认知训练范式,它在命名实体匿名的语料库上进行预训练,从而消除了与实体相关的事实监督的主要渠道。这种干预大大减少了闭卷事实回忆,同时通常可以提高以相关信息作为上下文提供的任务的性能。在多个模型尺度上,KLLM 在上下文问答、事实验证和幻觉检测基准方面始终优于匹配的基线。至关重要的是,在证据不完善的基于检索的环境中,KLLM 显示出更高的稳健性,并比标准语言模型实现高达 20--25\% 的相对增益。他们进一步表现出更好的校准,提高了 ECE、Brier 分数和 AUROC,以及更可靠的弃权行为。我们的结果表明,在预训练期间抑制与实体相关的监督会导致认知行为的转变:KLLM 更少依赖参数知识,更多依赖外部证据,从而提高现实条件下的可靠性。这表明对知识获取的预训练时间控制可以通过提供更加证据敏感的基础模型来补充检索增强和基于工具的系统。