论文

面向VLM智能体强化学习的统一评论家混合优势估计

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

大型视觉-语言模型(VLM)如今在交互式环境中充当智能体,其成功需要跨轮次连贯的推理与决策。尽管在智能体环境中进行端到端训练可以提升这种多轮决策能力,现有方法主要依赖两种方式之一:对拼接的词元轨迹做逐词元优化,或采用轮内均一信用的逐轮优化。在本工作中,我们为这两个层级的优化建立理论表述,并推导出一个同时服务两类目标的混合优势。进一步地,通过恰当选择折扣因子与学习目标,我们证明一个统一的评论家模型可以同时估计轮级与词级价值。据此,我们提出HyGAE,一个以混合优势与统一评论家联合优化词元级与轮级目标的演员-评论家框架。我们在五个多轮决策环境中对HyGAE进行了广泛评估,其平均成功率达91%,比其他方法显著提升10%。此外,我们提供了深入分析,表明混合优势与回报的精确解析形式对优化至关重要。项目页面:https://wx-zhang.github.io/hygae-web/。

面向VLM智能体强化学习的统一评论家混合优势估计:论文配图
图 1:VLM 的多轮决策任务。我们利用词元和回合级别的混合优势来更新 VLM 策略,同时通过统一的价值模型学习价值。