论文
GUIDE:通过实时网络视频检索与即插即用标注解决GUI智能体的领域偏置
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation
摘要
大型视觉-语言模型赋予了GUI智能体强大的界面理解与交互通用能力。然而,由于训练期间对领域专用软件操作数据的接触不足,这些智能体表现出显著的领域偏置——不熟悉特定应用的操作流程(规划)与UI元素布局(定位),限制了其在真实世界任务中的表现。本文提出GUIDE(GUI Unbiasing via Instructional-Video Driven Expertise),一个免训练、即插即用的框架,通过检索增强的自动标注流水线从网络教学视频中自主获取领域专长,解决GUI智能体的领域偏置。GUIDE引入两项关键创新。其一是字幕驱动的Video-RAG流水线,通过字幕分析解锁视频语义,执行领域分类、主题提取与相关性匹配的渐进三阶段检索,以识别与任务相关的教学视频。其二是基于逆动力学范式构建的全自动标注流水线,将经UI元素检测增强的连续关键帧输入视觉语言模型(VLM),推断所需的规划与定位知识,并注入智能体的对应模块,从而同时应对领域偏置的两种表现。在OSWorld上的大量实验证明,GUIDE作为即插即用组件,对多智能体系统与单模型智能体均具通用性。它在不修改任何模型参数或架构的情况下,持续带来超过5%的提升并减少执行步骤,验证了GUIDE是弥合GUI智能体领域偏置的架构无关增强。
