论文

Grep 是您所需要的吗? Agent 如何利用重塑 Agentic 搜索

Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

智能体系统Agent Harness

摘要

大语言模型 (LLM) 代理的最新进展启用了复杂的代理工作流程,其中模型自主检索信息、调用工具并对大型语料库进行推理以代表用户完成任务。尽管在代理搜索系统中越来越多地采用检索增强生成(RAG),但现有文献缺乏对检索策略选择如何与代理架构和工具调用范式交互的系统比较。重要的实际维度,包括如何将工具输出呈现给模型,以及当搜索必须处理更多不相关的周围文本时,性能如何变化,在代理循环中仍然没有得到充分探索。本文报告了一项分为两个实验的实证研究。实验 1 使用自定义代理工具 (Chronos) 和提供者本机 CLI 工具(Claude Code、Codex 和 Gemini CLI)对来自 LongMemEval 的 116 个问题样本进行 grep 和向量检索,以获得内联工具结果和模型单独读取的基于文件的工具结果。实验 2 比较了仅 grep 和仅向量检索,同时逐渐混合其他不相关的对话历史记录,以便每个查询都嵌入到更分散注意力的材料中以及重要的段落中。在实验 1 的比较中,在 Chronos 和提供商 CLI 中,grep 通常比向量检索产生更高的准确度;同时,即使底层对话数据相同,总体得分仍然很大程度上取决于所使用的工具和工具调用风格。