论文

GUIDE:通过实时网络视频检索与即插即用标注解决GUI智能体的领域偏置

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

上下文与知识检索增强

摘要

大型视觉-语言模型赋予了GUI智能体强大的界面理解与交互通用能力。然而,由于训练期间对领域专用软件操作数据的接触不足,这些智能体表现出显著的领域偏置——不熟悉特定应用的操作流程(规划)与UI元素布局(定位),限制了其在真实世界任务中的表现。本文提出GUIDE(GUI Unbiasing via Instructional-Video Driven Expertise),一个免训练、即插即用的框架,通过检索增强的自动标注流水线从网络教学视频中自主获取领域专长,解决GUI智能体的领域偏置。GUIDE引入两项关键创新。其一是字幕驱动的Video-RAG流水线,通过字幕分析解锁视频语义,执行领域分类、主题提取与相关性匹配的渐进三阶段检索,以识别与任务相关的教学视频。其二是基于逆动力学范式构建的全自动标注流水线,将经UI元素检测增强的连续关键帧输入视觉语言模型(VLM),推断所需的规划与定位知识,并注入智能体的对应模块,从而同时应对领域偏置的两种表现。在OSWorld上的大量实验证明,GUIDE作为即插即用组件,对多智能体系统与单模型智能体均具通用性。它在不修改任何模型参数或架构的情况下,持续带来超过5%的提升并减少执行步骤,验证了GUIDE是弥合GUI智能体领域偏置的架构无关增强。

GUIDE:通过实时网络视频检索与即插即用标注解决GUI智能体的领域偏置:论文配图
图 4:GIMP 对比度调整任务的定性示例(任务:“使图片的对比度更强”)。 (a) 如果没有领域知识,代理将默认使用“图像”菜单(×\次);从检索到的教程中规划知识会将其重定向到正确的“颜色”菜单 (1→\to2)。 (b) 基础知识提供了对比度滑块的视觉描述,从而能够在视觉上相似的控件之间进行精确识别。