论文
SkillLens:面向检索增强GUI动作预测与On-Policy蒸馏的视觉技能卡
SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation
摘要
操作计算机的智能体能够感知丰富的软件界面,但其决策往往缺乏视觉程序性记忆:它们可能认出单个控件,却无法判断当前处于哪个熟悉的工作流、下一个关键控件是什么、或何种证据能确认进展。原始交互轨迹保留了这类信息,但冗长且噪声大,难以作为条件输入;而纯文本技能往往遗漏使某个流程适用的视觉状态。我们提出视觉技能卡(Visual Skill Cards,VSCs),一种将可复用流程与适用性线索、视觉证据和验证信号绑定的状态条件化记忆表示。SkillLens通过Trace-to-Visual-Skill-Card从异构交互经验构建VSC,并在推理时检索相关卡片,仅为固定的视觉语言模型执行器选择性地展开其所需的证据,以实现有依据的GUI动作预测。同一表示还支持CardDistill,它将VSC证据作为特权教师上下文,训练一个在运行时无需卡片检索即可行动的学生模型。在Multimodal-Mind2Web和WebLINX-BrowserGym上,SkillLens使冻结的GPT-5.4-mini执行器的Step SR分别提升+11.6分、Overall提升+2.9分;CardDistill进一步将仅用学生的Qwen3-VL-2B对应指标提升+12.0分和+3.2分。
