论文

改进长程LLM智能体的子目标驱动框架

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

模型训练强化学习Agentic RL

摘要

基于大语言模型(LLM)的智能体已成为数字环境(包括移动界面、操作系统和网页浏览器)中强大的自主控制器。以网页导航为例,它需要处理动态内容与长序列动作,因而尤其具有挑战性。现有基于LLM的智能体在长程规划上主要面临两方面困难。在在线执行过程中,随着新信息到来,它们常常迷失方向,缺乏通往最终目标的清晰且自适应的路径。这一问题在强化学习(RL)微调期间进一步加剧,稀疏且延迟的奖励使智能体难以辨别哪些动作通向成功,致使其无法在长任务中保持连贯推理。为应对这些挑战,我们提出两项贡献。第一,我们提出一个智能体框架,利用专有模型通过子目标分解进行在线规划。第二,我们提出MiRA(Milestoning your Reinforcement Learning Enhanced Agent),一个使用密集的、基于里程碑的奖励信号的RL训练框架。实时规划机制使Gemini等专有模型在WebArena-Lite基准上的成功率(SR)绝对提升约10%。同时,将MiRA应用于开放的Gemma3-12B模型,其成功率从6.4%提升至43.0%。这一表现超越了GPT-4-Turbo(17.6%)与GPT-4o(13.9%)等专有系统,也超越了此前开放模型的最先进水平WebRL(38.4%)。总体而言,我们的发现表明,将显式的推理时规划与基于里程碑的奖励相结合,可显著提升智能体的长程能力,为更鲁棒、更通用的自主系统铺平道路。

改进长程LLM智能体的子目标驱动框架:论文配图
图1:Milestoning the Agents框架总览:以子目标分解引导LLM智能体完成长程任务并提升表现。