论文
SEVA:具有事实归因过程奖励的自我进化验证代理
SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution
摘要
幻觉是基于 LLM 的代理的可靠性瓶颈,而事实归因验证器是最后一道防线 - 然而今天的验证器仅发出不透明的二进制标签,使代理无法自我纠正,操作员无法审核。我们推出了 SEVA,这是一种结构化验证代理,它可以发出证据比对、逐步推理链、校准置信度以及六类错误诊断和可操作的修复。使用 RL 训练这样的智能体并非易事:多分量输出的标准二元奖励会触发优势崩溃——组内奖励方差消失,GRPO 梯度消失。我们通过过程奖励来解决这个问题,将验证质量分解为五个独立的部分,对过程信号按 70/30 加权,恢复梯度并引入隐式课程——代理首先掌握验证行为(对齐 0.917 -> 0.997,格式 72% -> 100%),然后是结果(F1 64.9 -> 69.0)。结构化输出进一步实现了“验证”->“反射”->“探测”->“细化”自我进化循环,在 7B 模型上的四轮中,该循环会出现意想不到的结构发现:每一轮都会产生基准专家,而不是通才(HaluEval 上+15 pp,同一模型中 TruthfulQA 上 -10 到 -14 pp,持续在 4 倍数据)。在 ClearFacts 上,SEVA-3B 与 GPT-4o-mini 相匹配(69.0 与 69.8 F1),同时产生更丰富、可审计的输出——确认了一个应该概括的原则:对于任何具有多组件生成的 RL 任务,奖励粒度必须与输出粒度相匹配。