论文
从可靠的否定中学习:GUI 基础的置信锚定测试时间适应
Learning from Reliable Negatives: Confidence-Anchored Test-Time Adaptation for GUI Grounding
摘要
图形用户界面 (GUI) 基础对于自主代理将自然语言指令映射到精确的屏幕坐标至关重要。然而,现有的监督微调和强化学习方法受到高标注成本的限制,造成了可扩展性瓶颈。在本文中,我们介绍了一种由两个关键见解驱动的无标签测试时训练范例:(1)坐标标记中的置信模式是比全序列置信度更好的指标,(2)在稀疏的 GUI 坐标空间中,负样本比潜在的有噪声的正样本提供更可靠的学习信号。我们首先提出置信锚定学习(CAL),它利用坐标标记置信度来过滤伪标签并分配基于距离的二元奖励。在此基础上,我们开发了置信锚定负学习(CANL),专门使用负样本来优化模型,以绕过不正确的正样本的风险。实验结果表明,CANL-7B 在 ScreenSpot-V2 上达到了 92.1%。在更具挑战性的 ScreenSpot-Pro 上,CANL-7B 达到 33.8%,比基本模型绝对提高了 8.9%。我们的研究结果建立了坐标词元信心,作为可扩展 GUI 代理开发的手动注释的强大替代方案。