论文
GUI-C$^2$:通过难度感知强化学习从粗到细的 GUI 基础
GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning
摘要
现有的用于 GUI 基础的代理强化学习方法有两个层面的局限性。在数据层面,当前的方法通常平等地对待所有训练样本,尽管它们对基线模型的训练价值存在困难。忽视这一点会大大降低训练效率甚至导致崩溃。在策略层面上,现有框架很难平衡裁剪较大区域以获得足够背景和裁剪较小区域以减少冗余之间的权衡,这是工具增强定位代理固有的紧张关系。此外,过于复杂的决策对于小参数模型来说是困难的,并且会显着增加推理时间。为了解决这些问题,在数据层面,我们提出了 GUI-D,一种数据挖掘和难度评分管道,通过适当的测试来识别值得训练的样本,并分配难度分数来指导后续的训练权重。在策略层面,我们提出了 GUI-C$^2$,它采用区域门控从粗到细的细化机制,通过模型内部的不确定性信号逐步缩小视野,自适应地保留大目标的上下文,同时放大小目标的精度,并通过改进感知阶段奖励来加强,确保每次细化真正推进基础。同时,我们简化了决策过程,大大减少了额外的推理时间。最后,大量的实验表明我们的方法实现了最先进的性能。代码和数据将公开。