论文

注入、对齐、恢复:暂存 后训练,用于免检索文档知识内化

Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

模型训练监督微调与指令调优

摘要

当推理时未检索源文档时,大语言模型 通常无法回答有关有界文档集合的问题。我们将这种设置研究为文档知识内化:将固定语料库转换为可用的参数化知识,以进行免检索问答。我们提出了 IAR(注入、对齐和恢复),这是一个三阶段 后训练 框架,它将结构化文档知识注入、QA 行为对齐和通用能力恢复分开。与传统的持续预训练不同,Inject 将源文档转换为延续、重写和指令条件重建目标。然后,Align 通过仅回答 QA 监督来调整注入模型,而 Recover 将域适应模型与基本指令模型合并以恢复一般功能。跨通用语料库 (CC) 和 CCI,以及跨 Llama、Phi、Qwen 和 SmolLM 模型系列,IAR 改进了领域-主领域-通用边界,以实现免检索文档内化。在主要比较中,IAR 在 8 个数据集模型设置中的 7 个中的所有四个报告指标上都比 Vanilla SFT 有所改进,在 IFEval、MMLU 和 MSBench 中,域 QA 准确性平均提高了 3.6 个百分点,平均总体性能提高了 12.1 个百分点。扩展的 CC 基线表明 LoRA 和 FAPM 可以赢得单独的一般指标,但在也达到领先或接近领先领域内部化的方法中,IAR 保留了最强的一般配置文件之一。