论文
代理技能应该超越文本:视觉技能的案例
Agent Skills Should Go Beyond Text: The Case for Visual Skills
摘要
可重用的技能是扩展代理能力的关键机制,使代理能够积累经验并解决日益复杂的任务。然而,大多数现有的技能学习方法将可重用的经验存储为纯文本资产,例如指令、推理轨迹或总结轨迹。我们认为,这种纯文本范式为以视觉为中心的任务造成了基本瓶颈,其中可重用的知识通常取决于空间布局、视觉基础、细粒度外观和局部状态变化。为了解决这个限制,我们提出了 \textbf{\NAME},一种将声明性文本逻辑与显式视觉支持相结合的多模式技能范式。我们区分了三种可重用的形式:稳定空间约定的静态先验,原位视觉工作记忆的动态先验,以及将有序文本步骤绑定到源框架、屏幕截图或证明它们的页面区域的交错视觉技能。视觉技能不仅仅描述要做什么,还编码在哪里看、如何检查以及如何验证视觉结果。为了扩展视觉技能构建,我们引入了 \textbf{\SYSTEM},这是一个自动系统,通过保留文本推理、空间参考、视觉边界和任务轨迹中的交互模式,将代理经验转换为可重用的多模态技能。 GUI 和其他以视觉为中心的任务的实验表明,视觉技能始终优于纯文本技能,特别是当成功需要空间对应、视觉证据和状态感知交互时。这些结果支持了我们的中心立场:可重用的代理技能应该超越文本,成为未来多模式代理的多模式资产。