论文

基于熵的选择性智能体指导:从不完美的视觉语言教师模型中学习自主策略

Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

模型优化模型训练强化学习蒸馏Agentic RL

摘要

视觉语言模型(VLM)为交互式决策提供了有用的先验,但直接将它们用作策略是昂贵且脆弱的:它们必须在每一步都进行查询,不能从环境交互中改进,并且可能会重复系统错误。我们研究如何从在线、昂贵、不完善但信息丰富的 VLM 老师那里学习廉价的自主策略。我们提出了 SAGE(通过熵的选择性代理指导),这是一个框架,仅在学习者不确定时查询 VLM,在训练期间执行建议的操作,并将指导提炼为轻量级强化学习(RL)策略。由于 VLM 建议并不总是可靠,SAGE 可以利用环境衍生的优势来衡量教师行动的提炼,而不是将所有建议视为同样有用。在稀疏奖励视觉推理和导航任务中,SAGE 学习在评估时没有 VLM 指导的情况下执行的策略,并在多种环境中比无指导的 RL 进行了改进,包括学习的策略超过其 VLM 教师的设置。结果表明,当 VLM 可以帮助智能体发现高回报轨迹时,选择性指导是最有益的,而当无指导的探索已经成功或教师的行为不会带来信息丰富的体验时,选择性指导的作用就较小。 SAGE 还通过仅提示教师执行一小部分训练步骤并且在部署时不需要 VLM 调用来减少 VLM 的使用。总体而言,我们的结果表明,VLM 不需要用作固定策略即可发挥作用;相反,它们可以充当临时的、不完美的指导来源,其价值通过互动得到检验和内化。

基于熵的选择性智能体指导:从不完美的视觉语言教师模型中学习自主策略:论文配图
图2 SAGE概览。学生在每次培训步骤中,当其正常政策编码Hhat_mathcal{H低于门槛值时,就会采取行动;否则,SAGE会询问被冻结的VLM教师并执行建议的行动。转换标记为 gtgt} , 并分隔成由学生生成的 Bmathcal{Bpi} 和教师引导的 BT\mathcal{BT} 子集 。PPO 在 Bmathcal{Bpi} 上更新角色, BC 使用 B\ mathcal{BT} 的教师动作, 并且对数值函数进行了全缓冲 B\ mathcal{B} 的培训 。