论文

通过证据蒸馏与回写增强训练知识库

Training the Knowledge Base through Evidence Distillation and Write-Back Enrichment

上下文与知识知识获取与更新

摘要

检索增强生成(RAG)系统中的知识库通常只组装一次且从不修订,尽管查询所需的事实往往碎片化地散布在多个文档中并被埋没在无关内容里。我们主张将知识库视为可训练的组件,并提出WriteBack-RAG框架:利用标注样例定位检索成功之处,分离出相关文档,将其蒸馏为紧凑的知识单元,并与原始语料一同建立索引。由于该方法只修改语料,它可作为离线预处理步骤一次性应用,并与任何RAG流水线组合。在四种RAG方法、六个基准和两个LLM底座上,WriteBack-RAG改进了所有受测设置,平均提升+2.14%。跨方法迁移实验进一步表明,蒸馏出的知识对生成它的流水线之外的其他RAG流水线同样有益,证实改进源于语料本身。

通过证据蒸馏与回写增强训练知识库:论文配图
图 2:WriteBack-RAG 管道。在训练期间(上),两阶段的门控机制会识别检索有帮助的示例并选择贡献文档。LLM蒸馏器将选定的证据融合成一个紧凑的知识单元,该知识单元被索引到一个单独的回写语料库中。在测试期间(底部),检索器搜索组合知识源,而检索器或生成器没有任何更改。