论文
ViSkill:通过不断发展的视觉原生技能强化 VLM 代理
ViSkill: Reinforcing VLM Agents with Evolving Visual-Native Skills
摘要
技能增强代理通过将成功的轨迹提炼成可重复使用的策略来提高样本效率。然而,大多数现有方法仍然以文本为中心,将空间布局和动作状态对应线性化为失去关键几何结构的语言。最近的努力已经开始纳入视觉证据,但与政策优化分开构建和更新技能,从而使它们的相互改进尚未得到充分探索。我们提出了 ViSkill,一种视觉原生技能学习框架,它将成功的交互编码为 VLM 代理可以直接访问的复合视觉技能卡。检索到的技能指导推理和奖励塑造,而成功的轨迹则被提炼回库中,形成一个封闭的反馈循环,其中技能积累和政策改进相互促进。可选的冷启动机制进一步加速早期学习。在 Sokoban、FrozenLake 和 PrimitiveSkill 上进行评估,ViSkill 的总体成功率为 0.89,通过冷启动初始化上升到 0.91,优于所有测试 评估专有和开源基线,同时收敛速度比标准 PPO 更快。我们的代码可在 https://github.com/ZJU-REAL/ViSkill. 获取