论文

F$^{2}$DR:深度搜索工作流程的细粒度全管道奖励框架

F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows

智能体系统Agent任务评测

摘要

随着大型语言模型 (LLM) 的广泛工业部署,深度搜索已成为解决复杂用户查询的主导范例。它通常通过迭代闭环工作流程运行,包括规划和反思、信息检索和答案生成。然而,现有的奖励模型(RM)和评估基准主要是针对静态单轮任务而设计的,无法捕捉深度搜索工作流程的全流程复杂性。为了解决这个限制,我们提出了 F2DR,一个细粒度的全管道 DeepSearch 奖励框架。 F2DR 从三个维度评估 DeepSearch 工作流程:内容、轨迹和答案,从而实现全面的流程级评估。我们进一步构建了DeepSearch RM-Bench,一个用于在DeepSearch场景中评估RM的专用基准。大量实验表明,F2DR 比基于自我评估的基线实现了显着更高的评估一致性,而 DeepSearch RM-Bench 在现有开源 RM 中表现出强大的判别能力。我们将很快公开发布完整的 DeepSearch RM-Bench 数据集。