论文

RAPO:通过检索增强策略优化扩展 LLM 智能体的探索

RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization

模型训练强化学习Agentic RL

摘要

Agentic 强化学习(Agentic RL)在基于大语言模型(LLM)的智能体中展现出显著潜力。这些工作能让 LLM 智能体借助多步、工具集成推理处理复杂任务。然而,现有 Agentic RL 方法的固有局限是依赖纯 on-policy 范式探索,把探索限制在智能体自生成输出内,阻碍发现新的推理视角以进一步改进。虽然近期工作引入辅助 off-policy 信号增强探索,但通常用完整 off-policy 轨迹做轨迹级策略估计,忽视智能体 rollout 内细粒度、步骤级探索动态的必要性。本文重新审视 Agentic RL 中的探索,提出检索增强策略优化(RAPO),一个通过引入检索显式扩展训练期探索的新 RL 框架。为此,我们把 Agentic RL 训练过程分解为两个阶段:(i)混合策略 Agentic Rollout 和(ii)检索感知策略优化。具体地,我们提出混合策略 Agentic Rollout 策略,让智能体能在检索到的 off-policy 步骤级轨迹上持续推理。它动态扩展智能体的推理感受野,支持以外部行为为条件的更广探索。随后,我们提出检索感知策略优化机制,用检索奖励与重要性塑形校准策略梯度估计,稳定训练并优先检索启发的探索。大量实验表明,RAPO 在三个 Agentic 推理任务的十四个数据集上平均增益 +5.0%,同时训练效率提升 1.2 倍。

RAPO:通过检索增强策略优化扩展 LLM 智能体的探索
图2:RAPO 概览。RAPO引入了一种混合策略智能体Rollout策略,支持离策略条件化推理,使智能体能够接收检索到的离策略轨迹,从而把探索拓展到其内在推理行为之外。同时,它引入了带检索奖励与重要性整形(importance shaping)的检索感知策略优化机制,确保训练期间策略梯度估计的有效与稳定。