论文

在高动态环境中对 GUI智能体 进行基准测试和改进

Benchmarking and Improving GUI Agents in High-Dynamic Environments

智能体系统Agent任务评测

摘要

图形用户界面 (GUI) 代理的最新进展主要集中在监督 微调 (SFT) 和强化学习 (RL) 等训练范例上。然而,高动态 GUI 环境的挑战在很大程度上仍未得到充分探索。现有的代理通常在每个动作后依赖单个屏幕截图来进行决策,从而导致部分可观察(甚至不可观察)的马尔可夫决策过程,其中包含重要动作信息的关键 GUI 状态通常无法充分捕获。为了系统地探索这一挑战,我们引入了 DynamicGUIBench,这是一个全面的在线 GUI 基准测试,涵盖十个应用程序和不同的交互场景,其特征是操作之间的重要界面变化。此外,我们提出了DynamicUI,一种为动态界面设计的代理,它以交互过程的屏幕录制视频作为输入,由三个组件组成:动态感知器、细化策略和反射。具体来说,动态感知器对 GUI 视频的帧进行聚类,生成质心的标题,并迭代地选择信息最丰富的帧作为显着的动态上下文。考虑到所选帧和代理的文本上下文之间可能存在不一致和噪声,细化策略采用动作条件过滤来细化思想,以减轻思想-动作的不一致和冗余。基于精细化的智能体轨迹,反射模块为进一步的行动提供有效、准确的指导。 DynamicGUIBench 上的实验表明,DynamicUI 显着提高了动态 GUI 环境中的性能,同时在其他公共基准测试中保持了具有竞争力的性能。