论文

GrepSeek:训练搜索代理以进行直接语料库交互

GrepSeek: Training Search Agents for Direct Corpus Interaction

上下文与知识检索增强

摘要

大语言模型 (LLM) 搜索代理通过迭代推理和检索在知识密集型任务上表现出了强大的前景。大多数现有系统依赖于 检索器 从预先构建的索引返回排序文档。我们探索了一种补充范例,其中代理将语料库视为搜索环境,并通过可执行的 shell 命令查找证据。我们引入了 GrepSeek,这是一种优化的直接语料库交互 (DCI) 代理,可以学习在大型文本语料库中查找、过滤和撰写证据。为了稳定大型语料库上的强化学习(RL),我们分两个阶段进行训练:首先,我们使用由答案感知导师和答案盲规划者生成的经过验证的、基于因果关系的搜索轨迹来初始化策略;然后,我们使用组相对策略优化(GRPO)来细化策略。为了使 DCI 大规模实用,我们引入了两种保留语义的执行优化:修剪自适应命令执行,它使用紧凑的辅助结构,在包含 2100 万个文档的 14GB 语料库上,将基于 shell 的搜索延迟降低了高达 77 倍;以及分片并行语料库搜索,它无需额外的预处理即可实现高达 7.6 倍的加速;两者都保持与顺序执行的等效性。在八个开放域 QA 基准测试中,GrepSeek 实现了最强的整体性能,与最佳基准相比,统计上显着的相对改进为 5.7\%$。我们的分析展示了 DCI 优化的智能体如何通过直接语料库交互进行灵活有效的组合搜索。