论文
Agent-G²:面向Agentic强化学习的高斯引导
Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning
摘要
基于提示(hint)的强化学习通过在每次rollout前保留专家轨迹的一段前缀,让策略从更接近成功的状态出发探索,从而应对长视界Agentic任务中的奖励稀疏问题。其有效性取决于引导深度:保留轨迹的多少。现有方法将该深度视为确定性标量。调度式方法在样本间共享一个值,忽略逐任务异质性;逐样本探测则估计它,但代价是额外rollout。我们发现,有用的引导占据一个深度带,其信息量分布近似以带中心为中心的高斯,而非集中于单一最优点。我们提出Agent-G²,一个高斯引导框架,从已为策略优化收集的rollout在线估计高斯的中心与展宽,逐任务抽取深度,无需探测rollout或学习一个深度预测器。中心结合全局基线与逐簇难度,展宽跟踪簇内方差。我们在Qwen2.5-1.5B / 7B-Instruct上于ALFWorld和WebShop评估Agent-G²。Agent-G²在ALFWorld上以不到逐样本探测三分之一的rollout成本,分别超越最强提示式、无提示和Aux-RL基线2.3 / 3.9 / 7.4分。
