论文

从裁决到过程:多阶段事实验证的智能体强化学习

From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

模型训练强化学习Agentic RL

摘要

最近将大型语言模型 (LLM) 与检索增强推理相结合的方法已显示出自动事实验证的前景。为了处理复杂的索赔,这些验证管道通常执行多阶段工作流程,协调紧密耦合的模块,包括索赔分解、证据收集和判决预测。然而,现有的方法单独优化各个阶段或依赖固定的启发式方法,这限制了阶段之间的适应性协调,并可能导致次优结果。在这项工作中,我们提出了 ProFact,一种代理强化学习框架,用于多阶段事实验证轨迹的端到端优化。 ProFact 训练统一的策略来协调索赔分解、证据查找、答案生成和判决预测。为了解决最终准确性标签提供的稀疏和延迟监督问题,ProFact 引入了过程感知奖励,可在整个验证过程中提供阶段级学习信号。实证评估表明,ProFact 在验证性能和推理效率方面始终优于强大的基线。这些结果凸显了流程感知轨迹优化对于多阶段事实验证的有效性。

从裁决到过程:多阶段事实验证的智能体强化学习:论文配图
图 1:ProFact 概述。 ProFact 通过涉及主张分解、证据检索和准确性预测的多阶段基于证据的轨迹来验证主张,并通过强化学习端到端地优化该轨迹。