论文

将文档与问题对齐:面向问题的文档重写以实现检索增强生成

Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation

上下文与知识上下文工程

摘要

检索增强生成 (RAG) 通过合并检索到的文档和/或生成的上下文来增强 大语言模型 (LLM) 的真实性。然而,LLM 在呈现混合上下文时经常表现出文体偏见,偏爱流畅但幻觉的生成内容,而不是基于事实但杂乱无章的检索证据。这种现象表明,检索到的信息的效用因其呈现方式而受到瓶颈。为了弥补这一差距,我们提出了 QREAM,这是一种风格控制的重写器,可以将检索到的文档与面向问题的风格对齐,同时保留事实,更好地供 LLM 读者使用。我们的框架由两个阶段组成:(1)QREAM-ICL,它使用风格种子来指导迭代重写探索; (2) QREAM-FT,一种从去噪 ICL 输出中提取的轻量级学生模型。 QREAM-FT采用双标准拒绝抽样,根据答案正确性和事实一致性进行过滤,以确保高质量的监督。 QREAM 作为即插即用模块无缝集成到现有 RAG 管道中。实验表明,QREAM 持续增强了先进的 RAG 管道,在延迟开销可忽略不计的情况下实现了高达 8% 的相对改进,有效平衡了问题相关性与事实基础。