论文

GUI-CIDER:通过因果内化和密度感知样本重选进行中期训练 GUI智能体

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

模型训练合成数据

摘要

尽管多模式 大语言模型 在构建图形用户界面 (GUI) 代理方面取得了快速进展,但由于缺乏有关 GUI 操作的世界知识,它们的实际任务完成从根本上受到瓶颈。现有的解决方案通常依赖于昂贵的多代理支架或传统的 后训练 范例,例如监督 微调 (SFT) 和强化学习 (RL)。然而,后训练 只允许智能体通过动作注释或奖励信号隐式吸收世界知识,导致低效的轨迹记忆而不是真正的理解。因此,一种能够显式学习这些知识的方法势在必行。为此,我们提出了 GUI-CIDER,这是一种中期训练方法,通过因果内化和密度感知样本重选来明确内化 GUI 世界知识。 GUI-CIDER 分三个阶段运行:(1)数据合成,将 GUI 轨迹中的静态规划和动态因果知识提炼为文本; (2)样本重选,通过奖励因果结构和惩罚语义冗余来过滤语料库; (3) 训练中期,使用提炼后的数据嵌入所获得的知识。对两个 GUI 知识基准和三个任务完成基准的大量实验表明,GUI-CIDER 持续提高了代理对 GUI 操作的理解及其任务成功率。代码可在 https://github.com/Wuzheng02/GUI-CIDER 获取。