论文

在不完美先验下学习可靠的 GUI Agent

Learning Reliable GUI Agents under Imperfect Priors

模型训练监督微调与指令调优

摘要

基于大型语言和视觉语言模型构建的 GUI Agent仍然难以应对看不见的应用程序和复杂的多步骤任务,因为完成真正的 GUI 任务取决于特定于应用程序的、暂时不稳定的操作知识,而这些知识在预训练语料库中是稀缺的。检索增强执行提供了一种自然的补救措施,但面临两个耦合瓶颈:大规模知识难以获取,并且由于版本更新、促销、广告、A/B 测试和个性化,自我收集的先验不可避免地会偏离实时环境。因此,我们认为 GUI 智能体不应该追求完美的知识,而应该学会在不完美的先验条件下正确行动,并提出我们的框架,将知识获取与噪声鲁棒利用相结合:结构化探索策略遍历交互元素,构建 UI 状态转换图,并通过 VLM 合成(任务,轨迹)对,无需人工注释;一种基于真实 GUI 漂移模式分类的噪声感知训练策略,将五种类型的现实错误注入到自我探索的轨迹中,以教导Agent在行动之前评估先前的可靠性。在物理设备和在线模拟器基准测试上的实验表明,我们的方法发现了更多独特的屏幕,涵盖了更多基准测试任务,并且在利用正确的先验知识的同时更有效地拒绝了错误的先验知识,并具有跨数据集传输的准确性增益。