论文
SafeGround:通过不确定性校准判断何时信任GUI grounding模型
SafeGround: Know When to Trust GUI Grounding Models via Uncertainty Calibration
摘要
图形用户界面(GUI)grounding旨在将自然语言指令转换为可执行的屏幕坐标,从而实现自动化GUI交互。然而,错误的grounding可能导致代价高昂、难以逆转的操作(如错误的支付批准),引发对模型可靠性的担忧。本文提出SafeGround,一个面向GUI grounding模型的不确定性感知框架,通过测试前的校准实现风险感知的预测。SafeGround利用分布感知的不确定性量化方法,从任意给定模型输出的随机样本中捕捉空间离散度。随后,通过校准过程,SafeGround推导出具有统计保证的虚发现率(FDR)控制的测试时决策阈值。我们将SafeGround应用于多个GUI grounding模型,并在具有挑战性的ScreenSpot-Pro基准上评测。实验结果表明,我们的不确定性度量在区分正确与错误预测方面始终优于现有基线,而校准后的阈值能可靠实现严格的风险控制,并带来系统级精度大幅提升的潜力。在多个GUI grounding模型上,SafeGround相比仅用Gemini推理将系统级精度最多提升5.38个百分点。
