论文
MMSkills:迈向通用视觉智能体的多模态技能
MMSkills: Towards Multimodal Skills for General Visual Agents
摘要
可复用技能已成为提升智能体能力的核心基底,但现有技能包大多将可复用行为主要编码为文本提示、可执行代码或学习到的例程。然而对视觉智能体而言,程序性知识本质上是多模态的:复用不仅取决于执行什么操作,还取决于识别相关状态、解读进展或失败的视觉证据,以及决定下一步做什么。我们将这一需求形式化为多模态程序性知识,并应对三个实践挑战:(I) 多模态技能包应包含什么;(II) 此类技能包可以从公开交互经验中的何处导出;(III) 智能体如何在推理时查阅多模态证据,而不引入过多图像上下文或过度锚定参考截图。我们提出MMSkills,一个用于表示、生成和使用可复用多模态程序以支持运行时视觉决策的框架。每个MMSkill是一个紧凑的、以状态为条件的包,将文本程序与运行时状态卡和多视角关键帧耦合在一起。为构建这些包,我们开发了智能体式的轨迹到技能Generator,通过工作流分组、程序归纳、视觉视觉关联和元技能引导的审计,把公开非评测轨迹转化为可复用多模态技能。在使用端,我们提出分支加载的多模态技能智能体:选定的状态卡与关键帧在临时分支中检视、与实时环境对齐,并蒸馏为给主智能体的结构化指导。在GUI与游戏类视觉智能体基准上的实验表明,MMSkills持续改进前沿与更小的多模态智能体,表明外部多模态程序性知识能够补充模型内部先验。
