论文
从裁决到过程:多阶段事实验证的智能体强化学习
From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification
摘要
最近将大型语言模型 (LLM) 与检索增强推理相结合的方法已显示出自动事实验证的前景。为了处理复杂的索赔,这些验证管道通常执行多阶段工作流程,协调紧密耦合的模块,包括索赔分解、证据收集和判决预测。然而,现有的方法单独优化各个阶段或依赖固定的启发式方法,这限制了阶段之间的适应性协调,并可能导致次优结果。在这项工作中,我们提出了 ProFact,一种代理强化学习框架,用于多阶段事实验证轨迹的端到端优化。 ProFact 训练统一的策略来协调索赔分解、证据查找、答案生成和判决预测。为了解决最终准确性标签提供的稀疏和延迟监督问题,ProFact 引入了过程感知奖励,可在整个验证过程中提供阶段级学习信号。实证评估表明,ProFact 在验证性能和推理效率方面始终优于强大的基线。这些结果凸显了流程感知轨迹优化对于多阶段事实验证的有效性。
