论文
MMG2Skill:Agent能否将野外指南提炼成自我进化技能?
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
摘要
网络上丰富的程序知识对于帮助智能体解决长期任务具有巨大的潜力。然而,此类知识往往是多模态的、异构的、有噪声的,并且隐含地假设了人类执行者,因此很难直接用作代理所需的技能。为了弥合以人为本的指南和代理可执行技能之间的差距,我们将这个问题形式化为指南到技能学习:将野外指南转换为可执行技能,并从代理可观察到的轨迹不断改进它们。为了评估现有智能体执行此任务的能力,我们引入了 MMG2Skill-Bench,这是针对此问题设计的第一个基准测试。我们进一步提出了 MMG2Skill,一个闭环框架,它将指南编译成可编辑的技能,在执行过程中根据这些技能调节固定视觉语言模型(VLM)代理,并根据轨迹级根本原因反馈修改技能,而不使用基准分数。在 GUI 控制、开放式游戏玩法和六个 VLM 主干的战略卡牌游戏方面,MMG2Skill 在每个模型域设置中始终优于普通基线代理,在主干上实现 +12.8 至 +25.3 个百分点的宏观平均增益。消融研究表明,使用原始指南直接提示代理可能会降低性能,而结构化技能构建和轨迹驱动的修订对于观察到的改进都是必要的。在可推断成功的任务中,基于分析器的提前停止进一步防止后期性能下降,并在正确校准成功信号时节省 25%-53% 的尝试次数。