论文

容量足够后,数据质量更重要:将文档知识写入 LoRA 适配器用于闭卷问答

Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA

模型训练参数高效训练

摘要

研究通过 LoRA 将文档知识直接写入四位 Gemma-4-e4b 的权重,使模型在无需检索和上下文窗口预算的条件下回答语料问题。从单篇文档到 99 篇文档语料,约百次训练显示,适配器容量足够后,训练数据质量是闭卷准确率的主导因素,超过 LoRA 的秩、学习率和两种替代架构合计的影响;容量不足时,数据干预则无法弥补。一次数据整理将标准答案规范为一至六词的短片段,并删除琐碎问题,使十五文档语料的闭卷准确率从 57.7% 提升至 85.7%,增幅超过任何架构变更。研究确认秩需要随语料规模增加,也发现秩与学习率存在此前误判的耦合。在十五文档子集上,加入真实检索基线后,知识内化适配器的召回率为 84.2%,高于使用基础阅读模型的 BM25-RAG 的 58.9%,以及提供真实标准证据块的 oracle 的 65.6%,且延迟更低。论文记录了包括三次误诊在内的完整过程,作为实证调试大模型训练的案例。