论文

学习探索:经探索感知策略优化扩展智能体推理

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

模型训练强化学习Agentic RL

摘要

代理测试时间扩展的最新进展允许模型在采取最终行动之前收集环境反馈。现有方法的一个关键限制是它们通常采用无差别的探索策略,缺乏自适应区分何时真正需要探索的能力。在本文中,我们提出了一种探索感知强化学习框架,使 LLM 智能体仅在不确定性较高时才进行自适应探索。我们的方法通过变分推理引入了细粒度奖励函数,通过估计探索性行为改善未来决策的潜力来明确评估探索性行为,以及探索感知分组机制,在优化过程中将探索性行为与任务完成行为分开。通过瞄准信息差距,这种设计允许代理有选择地探索,并在任务上下文明确后立即过渡到执行。根据经验,我们证明我们的方法在一系列具有挑战性的基于文本和基于 GUI 的代理基准测试中实现了一致的改进。代码可在 https://github.com/HansenHua/EAPO-ICML26 获取,模型可在 https://huggingface.co/hansenhua/EAPO-ICML26 获取。

学习探索:经探索感知策略优化扩展智能体推理
图 22:步骤 1 中 EAPO 的可视化。