论文

WinDOM:面向小模型GUI定位的自家族蒸馏

WinDOM: Self-Family Distillation for Small-Model GUI Grounding

模型优化模型训练强化学习蒸馏RLVR

摘要

小型(约2B)GUI定位智能体对设备端部署、无障碍工具与低成本迭代有吸引力——但在此规模上面临两个开放配方问题:如何在不昂贵人工标注下获得边界框训练数据——以及如何组合监督微调与强化学习。我们同时解决两者——明确目标为推升小模型性能而非扩大规模。WinDOM是54,425条记录的定位语料——经无头Playwright驱动开源Windows 11网页重实现采集——边界框直接从DOM读取——无OCR或人工标注。自家族蒸馏(SFD)是仅由教师选择参数化的单次拒绝采样冷启动:学生自身的EMA(无外部模型)或冻结的更大同家族教师。随后我们把SFD冷启动的饱和深度当作显式GRPO超参数。在Qwen3.5-2B学生上——欠饱和冷启动是比收敛冷启动更好的GRPO初始化:SFD-4B配早启RL较基座获得+5.4 OOD均值(+3.5 ScreenSpot-Pro、+7.0 OSWorld-G、+5.8 ScreenSpot-V2)。同尺寸EMA模式距跨尺寸4B变体约一个OOD均值点(65.2对66.3)——且无需外部教师。

WinDOM:面向小模型GUI定位的自家族蒸馏:论文配图
图 1:我们最佳配置的管道。第一阶段(蓝色):冻结的同家教师 πT\pi_{\mathrm{T}} 收到屏幕截图以及抖动的边界框提示;学生 πS\pi_{\mathrm{S}} 仅收到屏幕截图。错过 GT 框的教师推出将被拒绝,幸存的教师通过前向 KL 蒸馏损失 ℒKD\mathcal{L}_{\mathrm{KD}} 监督 πS\pi_{\mathrm{S}} (等式 9)。第 2 阶段(橙色):从步骤 100 SFD 检查点初始化,每个提示 πS\pi_{\mathrm{S}} 样本 G=8G{=}8 次推出;高斯点击边界框奖励的群体相对优势推动了 GRPO 更新。