论文
CuSearch:面向Agentic RAG的基于搜索深度的课程式Rollout采样
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
摘要
具有可验证奖励的强化学习(RLVR)已成为一种有前途的范例,用于通过仅结果监督来训练代理检索增强生成(RAG)系统。大多数现有方法通过均匀采样的推出来优化策略,隐式地将所有轨迹视为同等信息。然而,轨迹在搜索深度上有很大差异,因此信息量不一样:更深的搜索轨迹包含更多的检索决策点,并为检索子策略提供更密集的直接监督。此外,随着批内深度分布转向更高的值,这种异质性随着训练而增长,但统一的推出采样仍然对这种转变视而不见。为了解决这个问题,我们提出了 CuSearch,一个基于搜索深度贪婪分配(SDGA)的课程推出抽样框架,SDGA 是一个批量级运算符,可将固定更新预算重新分配给更深层次的搜索轨迹。 SDGA-Auto 始终以当前批次中最深的可用轨迹为目标,随着深度分布向上移动,产生隐式的与训练一致的课程。随着更深层次的轨迹变得足够丰富,SDGA 阶段明确提高了课程门槛。跨模型类型和检索框架的实验表明,CuSearch 持续提高性能,在 ZeroSearch 上比标准 GRPO 实现高达 11.8 个精确匹配点。这些结果将每轨迹搜索深度确立为基于 RLVR 的代理 RAG 训练中检索监督密度的可靠、无注释代理。代码可在 https://github.com/MrToser/CuSearch 获取。
