论文
超越随机探索:什么让训练数据对智能体搜索有价值
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search
摘要
强化学习(RL)已成为通过策略性整合外部搜索引擎来提升大语言模型(LLM)推理能力的有效途径。然而,当前基于RL的搜索智能体往往依赖由精心设计的结果奖励引导的随机探索过程,导致推理轨迹低效且训练不稳定。为解决这些问题,我们提出新框架分层经验(Hierarchical Experience,HiExp),以提升搜索智能体的性能与训练稳定性。具体而言,我们通过对比分析与多级聚类机制提取经验知识,将原始推理轨迹转化为分层经验知识。通过利用经验对齐训练,我们有效正则化随机探索,使其演进为策略性的、经验驱动的搜索过程。在多个复杂智能体搜索与数学推理基准上的大量评估表明,我们的方法不仅取得显著性能提升,还展现出强大的跨任务与跨算法泛化能力。
