论文

CRISP:训练高效深度搜索代理的关键步骤感知

CRISP: Critical Step Perception for Training Efficient Deep Search Agents

模型训练奖励建模与过程监督

摘要

大语言模型 (LLM) 越来越多地扩展到深度搜索代理,通过与外部搜索和浏览工具的多步骤交互来解决复杂的问题。然而,现有的代理通常会产生大量的计算和交互成本,生成包含冗余查询、低效探索和不相关观察的冗长轨迹。现有的以效率为导向的方法通常鼓励代理减少使用工具的频率,但统一处理所有工具交互也可能会抑制收集必要证据的步骤。在本文中,我们提出了 CRISP,一个通过关键步骤感知训练高效深度搜索代理的框架。与之前统一惩罚工具使用的效率方法不同,CRISP 区分收集必要证据和冗余证据的交互,并制定训练奖励以保留前者,同时修剪后者,从而在不牺牲正确答案所需证据的情况下提高效率。具体来说,CRISP 首先通过向后证据归纳构建关键步骤标签:从最终答案开始,强大的模型向后遍历完整的搜索轨迹,并判断每个工具交互步骤是否为最终答案提供或保留证据。然后,我们将这些逐步判断提炼为更小的关键步骤识别器,从而能够一次性进行全轨迹分析。在策略优化期间,效率感知奖励仅适用于成功执行轨迹。在 BrowseComp 和 HLE-Verified 上的实验表明,CRISP 保持了有竞争力的最终答案准确性,同时平均交互次数分别降低了 15.1% 和 33.2%,交互效率得到了显着提高。