论文

VISUALSKILL:计算机使用代理的多模式技能

VISUALSKILL: Multimodal Skills for Computer-Use Agents

智能体系统Agent Harness智能体互操作协议Agent SkillsMCP

摘要

计算机使用代理(CUA)在标准化基准上接近人类水平的表现,但在长期任务和看不见的软件上仍然挣扎。现有的技能库通过可重用的技能解决了这个问题,但尽管 GUI 交互具有视觉性质,但仅将技能工件表示为文本。我们提出 VISUALSKILL:一种分层多模式技能,针对每个目标应用程序量身定制,并组织为每个主题文件的中心索引,代理通过 load_topic MCP 工具使用该索引,按需获取相关主题的文本和图形。我们使用两阶段管道构建每项技能,该管道将编写的文档与实时应用程序 UI 探索相结合。在 CUA-World 和 OSExpert-Eval 这两个 CUA 基准测试中,由 Claude Opus 4.6 支持的 Claude Code CLI 代理的 VISUALSKILL 平均得分为 0.456,比无技能基线 (0.303) 提高了 +15.3 分。与从相同源内容生成且仅在形式上与 VISUALSKILL 不同的匹配纯文本技能相比,VISUALSKILL 比匹配的纯文本技能进一步获得 +8.3 分的绝对增益(0.373 比 0.456),提供直接证据表明在技能工件中保留视觉图形而不是用语言表达它们,有助于代理识别 UI 元素并在每个操作后验证工作流状态。我们的代码可在 https://github.com/XMHZZ2018/VisualSkills 获取。