论文
对抗又协作:检索增强语言模型中的多视角推理
Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models
摘要
将大型推理模型(LRM)与检索增强生成(RAG)协同的近期进展展现出可观成效,但仍有两个关键挑战:(1) 推理模型通常从单一、不受质疑的视角运作,限制了其基于外部文档开展深入、自我纠正推理的能力;(2) 现有训练范式过度依赖结果导向的奖励,难以为塑造复杂的多步推理过程提供充分信号。为解决这些问题,我们提出一个名为 Adversarial Reasoning RAG(ARR)的 Reasoner-Verifier 框架。Reasoner 与 Verifier 基于检索到的证据进行推理并相互批判对方的逻辑,同时由过程感知优势(process-aware advantage)引导,该优势无需外部打分模型。这一奖励将显式的观测信号与模型内部不确定性相结合,共同优化推理保真度与验证严格性。在多个基准上的实验证明了我们方法的有效性。
