论文

Agent-G²:面向Agentic强化学习的高斯引导

Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

基于提示(hint)的强化学习通过在每次rollout前保留专家轨迹的一段前缀,让策略从更接近成功的状态出发探索,从而应对长视界Agentic任务中的奖励稀疏问题。其有效性取决于引导深度:保留轨迹的多少。现有方法将该深度视为确定性标量。调度式方法在样本间共享一个值,忽略逐任务异质性;逐样本探测则估计它,但代价是额外rollout。我们发现,有用的引导占据一个深度带,其信息量分布近似以带中心为中心的高斯,而非集中于单一最优点。我们提出Agent-G²,一个高斯引导框架,从已为策略优化收集的rollout在线估计高斯的中心与展宽,逐任务抽取深度,无需探测rollout或学习一个深度预测器。中心结合全局基线与逐簇难度,展宽跟踪簇内方差。我们在Qwen2.5-1.5B / 7B-Instruct上于ALFWorld和WebShop评估Agent-G²。Agent-G²在ALFWorld上以不到逐样本探测三分之一的rollout成本,分别超越最强提示式、无提示和Aux-RL基线2.3 / 3.9 / 7.4分。

Agent-G²:面向Agentic强化学习的高斯引导:论文配图
图1:跨训练步 t0、t1、t2 的基于提示的强化学习范式。(a) 基于调度:各样本共享 dt。(b) 基于探测:每样本 O(log n) 次探测。(c) Agent-G2(我们的方法):每个任务 di∼N(μt,σt²),由现有 rollout 在线估计。