论文
SlimSearcher:通过自适应奖励门控训练效率感知网络代理
SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating
摘要
深度研究代理在复杂的信息搜索任务中表现出了非凡的能力,但这种能力的代价是高昂的计算成本。在以准确性为中心的训练范式的驱动下,当前的模型采用了暴力策略,其特点是盲目的工具依赖和执行推理,生成长而冗余的轨迹,而这些轨迹对于解决这些任务来说远远不是必需的,从而导致浪费的工具调用和过度的词元消耗。为了克服这种效率陷阱,我们提出了 SlimSearcher,这是一个原则框架,可以在监督 微调 (SFT) 和强化学习 (RL) 之间推动准确性和计算成本之间的帕累托前沿。在 SFT 阶段,SlimSearcher 采用帕累托有效过滤来提取既成功又经济的轨迹,引导模型走向本质上具有效率意识的搜索行为。在强化学习期间,我们引入了自适应奖励门控,这是一种动态奖励塑造机制,用于评估抽样群体内的相对工具和词元效率。通过将这些自适应效率指标与严格的正确性门级联,我们的方法有效地避免了与绝对惩罚相关的简洁性偏差,并减轻了 奖励作弊 的影响。对长期基准测试(包括 GAIA、BrowseComp 和 XBenchDeepSearch)的大量实验表明,SlimSearcher 将平均工具调用轮次减少了 17%-58%,同时保持或提高了准确性。