论文

CRITIC-R1:学习检索增强生成的结构化批评

CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation

模型训练奖励建模与过程监督

摘要

检索增强生成(RAG)通过结合外部证据来改进知识密集型问题的回答。然而,现有的 RAG 方法仍然存在幻觉和微妙的推理错误。最近的研究引入外部批评者来改进 RAG 输出,但它们经常提供粗粒度和弱结构化的反馈,表现出过度积极的干预,并导致嘈杂和不可靠的改进,限制了它们的校正有效性。为了解决这些问题,我们提出了 CRITIC-R1,这是一个结构化批评框架,它使用强化学习 (RL) 将 RAG 批评制定为明确的错误诊断问题并进行学习。我们的框架将常见的 RAG 错误分为多个诊断维度,包括判决、错误定位、推理分析和修复生成。为了学习这些能力,我们设计了两个奖励函数:保守判断对齐(CJA)首先鼓励校准的高水平判断,同时减轻过度攻击性现象,而诊断质量对齐(DQA)通过门控奖励进一步改善细粒度的诊断反馈。我们使用基于 GRPO 的 RL 以及从外部 LLM 教师模型收集的过程级监督来训练批评家模型。五个 QA 基准的实验表明,与强大的 RAG 基准相比,CRITIC-R1 持续提高了答案质量。我们的源代码位于 https://anonymous.4open.science/r/critic-r1-FCB0