论文

超越随机探索:什么让训练数据对智能体搜索有价值

Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search

模型训练强化学习Agentic RL

摘要

强化学习(RL)已成为通过策略性整合外部搜索引擎来提升大语言模型(LLM)推理能力的有效途径。然而,当前基于RL的搜索智能体往往依赖由精心设计的结果奖励引导的随机探索过程,导致推理轨迹低效且训练不稳定。为解决这些问题,我们提出新框架分层经验(Hierarchical Experience,HiExp),以提升搜索智能体的性能与训练稳定性。具体而言,我们通过对比分析与多级聚类机制提取经验知识,将原始推理轨迹转化为分层经验知识。通过利用经验对齐训练,我们有效正则化随机探索,使其演进为策略性的、经验驱动的搜索过程。在多个复杂智能体搜索与数学推理基准上的大量评估表明,我们的方法不仅取得显著性能提升,还展现出强大的跨任务与跨算法泛化能力。

超越随机探索:什么让训练数据对智能体搜索有价值:论文配图
图 1:随机探索与经验引导探索之间的比较。经验驱动的指导有助于更有效的推理轨迹,赋予LLM针对复杂任务的卓越问题解决能力。