论文

RAG 引文中的可归因后合理化:受控复制和 RLVR 比较

Attributable Post-Rationalization in RAG Citations: A Controlled Reproduction and an RLVR Comparison

模型评测评测方法与指标

摘要

RAG 系统可以为您提供正确的答案,并引用它实际未使用的来源。模型通过后合理化输出这些不忠实的引用:它们首先写下答案,然后将引用附加到任何看起来足够接近的段落上。搜索代理现在接受了来自可验证奖励(RLVR)的强化学习的训练,这为他们获得正确的答案提供了报酬。我们询问训练是否也教会他们诚实引用。通过所需的控制改进现有方法,我们仅使用免费 Kaggle GPU,在四个问答数据集上将指令调整模型与从中训练的三个 RLVR 代理进行比较。后合理化无处不在:在基于维基百科的问题上,大约七分之一的引用是不忠实的。 RLVR 没有解决这个问题。智能体按照其基本模型的速率进行事后合理化,其中一个的结果稍差。奖励正确答案并不能保证引文的忠实度,因此忠实度必须根据其本身的条件进行训练和衡量。