论文
解耦动作与位置:小型 GUI 基础模型如何接收操作类型?
Decoupling What from Where: How Should a Small GUI Grounding Model Receive the Action Type?
摘要
GUI 智能体决定采取哪种行动以及在哪里采取行动;我们询问小型接地模型应如何接收动作类型。 微调 Qwen2-VL-2B 在 Android 上使用 LoRA,我们将平坦基线与在匹配数据、计算和解码下提供类型的五种方式进行比较:辅助损失、硬路由动作词、附加学习嵌入、前置学习 token 以及写入提示中的类型。通过五个种子、剧集集群引导程序和种子级配对测试,混合流上的排名很清楚:辅助损失、附加嵌入和提示词均比基线获得了 5 到 7 个 hit@0.10 点,而硬路由和前置的 token 与基线无法区分。其中大部分收益是免受我们的预处理选择的影响,而不是空间先验。我们的序列化器将类型事件的离屏触摸点 AITW 记录固定到原点;该类别会降低基线的点击接地性,移除它会将基线提升近七点,此后没有任何机制的命中率可以击败它,并且间隔排除了两点效应,尽管辅助损失仍然缩短了平均失误;连续的点击和滑动都没有帮助。这是否可以推广到一个序列化之外,目前尚不清楚。对于部署而言,未建立预测类型而非黄金类型的管道相对于基线的裕度(+0.016,95% 区间 [-0.017,+0.052]),并且错误的类型会导致每个以推理为条件的模型崩溃。前置的 token 对共享学习率没有帮助,它的行几乎不会从初始化中移动;训练速度快了十倍,它达到了其他三名种子的水平,其差距是三名种子未建立的。我们还记录了一个无声的失败:通过inputs_embeds注入条件使得Qwen2-VL回落到图像token的一维位置,损失了9个点。
