论文

经交互轨迹挖掘为计算机使用智能体自动生成SKILL.md

Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

智能体系统模型训练强化学习Agent SkillsRLVR

摘要

显式技能库使计算机使用智能体更易检视——但此类库能否以改进下游策略的方式从交互数据中挖掘仍不清楚。我们经三阶段管线研究该问题:切分GUI轨迹、把分段聚类为候选技能、并从所得标注训练技能感知策略。挖掘出的聚类在源基准上可读:8个聚类中5个对InteraSkill Workflows标签纯度至少0.95。但可读不等于可迁移。GRPO仅把IW技能步准确率从18.5%提升到20.5%——BrowseComp+基本不变——且在关键源域指标上逊于平凡的频率先验。因此我们把该方法呈现为诊断研究:轨迹挖掘能暴露可检视的技能结构——但当前的边界检测器、无序分段表示与离线奖励模型不足以支撑可靠的跨域策略改进。

经交互轨迹挖掘为计算机使用智能体自动生成SKILL.md:论文配图
图 1:自动生成 SKILL.md 的研究设计。 IW是轨迹分割、技能库构建和第3阶段GRPO政策培训的源数据集; WebArena 和 BrowseComp+ 是已完成的保留转移支票。 Mind2Web 零样本和 WorkArena-NLP 仅作为诊断报告,而不作为当前 GRPO 转移证据。该论文评估了边界质量、集群质量、自动生成与手工制作的 SKILL.md 文件、简单先验以及已完成的传输检查。