论文
回答之前先了解:解码可靠 RAG 的语言模型
Knowing Before Answering: Decoding Language Models for Reliable RAG
摘要
在检索增强生成(RAG)中,检索可能提供回答问题所需的不充分或冲突的信息。系统不仅应该知道何时回答,还应该能够识别 RAG 中提供的文档不充分或包含冲突信息的情况。这可以被视为一个三向分类问题,其中我们使用模型的内部信号来确定输入中提供的信息是否可以分类为充分、不足或冲突。我们创建一个受控基准数据集,该数据集使用虚构信息复制 RAG 设置,并将每个实例标记为可回答、不足或冲突。我们使用隐藏激活和注意力衍生特征作为输入来训练轻量级线性模型来区分这三个类别。在跨越不同架构和一系列模型大小的 16 种语言模型中,我们基于特征的路由器始终优于基于提示的基线和专用 RAG 模型的性能。我们进一步对模型的信息动态进行分析。我们表明,最丰富的分类信号存在于中间层,在大多数测试模型中,隐藏激活状态比注意力值或 MLP 特征输出更有效。总的来说,我们的结果表明,语言模型内部编码检索到的证据是否足以支持回答,并且可以可靠地解码该信号以进行 RAG 分类。