论文

三思而后行:LLM智能体的自主探索

Look Before You Leap: Autonomous Exploration for LLM Agents

模型训练强化学习RLVRAgentic RL

摘要

基于大语言模型的智能体在陌生环境中常常因过早利用而失败:即倾向于在获取充分的环境特有信息之前就依据先验知识行动。我们将自主探索识别为构建自适应智能体的一项关键但研究不足的能力。为了形式化并量化这一能力,我们提出探索检查点覆盖率(Exploration Checkpoint Coverage),一个可验证的指标,衡量智能体发现关键状态、对象与可供性的广度。系统性评估显示,用标准任务导向强化学习训练的智能体一致表现出狭窄且重复的行为,妨碍下游表现。为解决这一局限,我们开发了一种训练策略,交替进行任务执行rollout与探索rollout,每类rollout由其对应的可验证奖励优化。在该训练策略的基础上,我们提出先探索后行动(Explore-then-Act)范式,将信息获取与任务执行解耦:智能体先利用交互预算获取接地于环境的知识,再将其用于任务求解。我们的结果表明,学会系统性探索对构建可泛化、可面向真实世界的智能体至关重要。

三思而后行:LLM智能体的自主探索:论文配图
图 1:面向任务的训练无法产生自主探索能力,导致智能体过早地利用熟悉的模式并获取有限的环境知识。我们通过 ECC 奖励明确优化探索,使智能体能够系统地发现环境结构、物体和可供性。由此产生的“探索然后行动”范式将信息收集与任务执行分离:代理首先探索以获取基础知识,然后利用它来解决下游任务。