论文

OpenFC:学习开放搜索事实检查的验证策略

OpenFC: Learning Verification Policies towards Open-Search Fact Checking

模型训练强化学习Agentic RL

摘要

开放搜索事实检查不仅仅是先检索然后分类,而是一个顺序决策问题,其中每次查询、源访问和停止决策都会重塑可用于验证的证据。然而,现有系统通常将这些决策分布在预定义的管道或单独提示的模块中,而不是将它们作为统一的特定于任务的策略来学习。我们引入了 \textbf{OpenFC},这是一个统一的验证策略训练框架,可将 Qwen3-8B 进行后训练,作为推理、证据获取和停止的紧凑型下一步动作控制器。 OpenFC 分两个阶段学习该策略。 \textbf{逐步校准冷启动(SCCS)}使用强大的培训时间监督者来审查初始推理后、工具使用以及执行前停止提案,从而为监督微调生成可靠的轨迹,而无需获得黄金判决。然后,验证感知强化学习(VA-RL)通过预算感知工具奖励、标签感知优势重新加权和本地化响应屏蔽来改进未解决索赔的冷启动策略。在六个事实检查基准中,OpenFC 实现了 70.39% 的平均准确度和 63.30% 的宏 F1,这是评估方法中总体平均值最高的。分阶段消融进一步表明 SCCS 和 VA-RL 提供互补增益,支持两阶段训练框架的设计。这些结果使 OpenFC 成为开放搜索事实核查的强大而有效的框架。我们将开源代码并发布模型检查点以支持可重复性。