论文
KItCAT:通过输入损坏进行知识注入以进行自回归训练
KItCAT: Knowledge Injection via Input Corruption for Auto-regressive Training
摘要
LLM 在 预训练 期间获得了大量知识,但通常缺乏回答来自利基来源的问题所需的专业知识,例如在 预训练 期间未见过的手册或技术文档。续 预训练 (CPT) 被广泛用于将此类知识注入模型参数。然而,利基文档很少重复事实,这使得 CPT 很难稳健地获取这些知识。最近的工作通过生成新知识的多个释义来解决这个问题,但释义的计算成本很高,并且通常需要强大的 LLM。在这项工作中,我们介绍了 KItCAT:通过损坏的自回归训练进行知识注入,这是一种轻量级训练策略,可以减少仅解码器 LLM 中的释义需求。 KItCAT 通过随机破坏输入序列来增强标准的下一个标记预测。在训练期间,输入标记的随机子集被其他词汇标记替换,而原始的下一个标记标签保持不变。这种简单的干预从每个样本中生成不同的训练输入,从而以可忽略不计的成本实现大规模数据增强。我们表明,KItCAT 在多个数据集和模型系列中始终优于 CPT。代码可在 https://github.com/meghanadhpulivarthi/KItCAT 获取。