论文
EAVer:作为端到端代理策略的长格式事实验证
EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy
摘要
长格式事实性验证通常作为静态分解-搜索-验证管道来实现,其中单独提示的模块处理声明并调用外部搜索。独立处理权利要求会使 LLM 和搜索调用随着权利要求数量而扩展,并导致重复搜索有关相关权利要求的重叠证据。我们引入了 EAVer,一种端到端代理验证器,它学习将完整的响应级验证工作流程作为统一策略进行控制。 EAVer 对语义相关的声明进行分组,根据置信度将每个组路由到直接验证或有针对性的搜索,并将搜索返回的证据保留在紧凑的上下文备忘录中,以便跨声明重用。为了训练这一策略,我们开发了一个特权教师综合管道,通过实时搜索而不是事后推理将黄金声明注释转换为可执行的多轮工具交互轨迹。结构、标签对齐、工具使用、搜索预算和泄漏检查产生 1,447 个质量控制轨迹。我们进一步构建了 794 个双向相同轨迹偏好对,使主张分组、搜索和证据保持固定,从而实现基于事实决策标记的以决策为中心的直接偏好优化 (DPO)。 Qwen3-8B 的结果表明,EAVer 在每个基准测试中都比最强的基于搜索的基线在 VeriFastScore 上高出 2.88 Macro-F1 点,在分布外 FaStFact-Bench 上高出 4.73 点,同时使用的搜索量比最搜索效率最高的基线少约 80%。此外,EAVer 持续提高了从 4B 到 32B 参数范围内的模型的性能,展示了其强大的通用性。