ProCUA-SFT 技术报告
ProCUA-SFT Technical Report
摘要
训练计算机使用代理(CUA)——通过屏幕截图和键盘/鼠标操作与图形桌面交互的模型——需要在完整的桌面环境中收集大规模、多样化的轨迹数据。最大的公共资源 AgentNet(22.5K 人类轨迹)在用于监督 微调 (SFT) 时会导致负迁移:在 AgentNet 上继续训练 UI-TARS 7B 会导致 OSWorld 成功率从 26.3% 下降到 8-10%。我们提出了 ProCUA-SFT,这是一个从 2,484 个应用程序组合的 93K 合成轨迹中提取的 310 万步级 SFT 样本的数据集。该数据集由完全自动化的管道生成,该管道 (i) 在植入真实世界内容的实时桌面上合成具有实际场景依据的任务 - 来自 SpreadsheetBench 的 912 个电子表格、来自 Zenodo10K 的大约 10K 个许可演示文稿以及多应用程序 OSWorld 配置 - 以及 (ii) 在生成轨迹之前通过二值前置条件检查验证每个任务的可行性。单个 VLM (Kimi-K2.5) 充当目标生成器、前提条件判断器和轨迹执行器,消除了规划者与执行者的能力差距。 Each trajectory is expanded into step-prefix samples that exactly reproduce the context layout seen at inference time. 微调 UI-TARS 7B 在 ProCUA-SFT 上的一个 epoch 在 OSWorld 上的收益率为 45.0%,比基本模型提高了 18.7 个百分点,比 AgentNet 训练的模型高出 35% 以上。 A subset of ProCUA was incorporated into the training data for the Nemotron 3 Nano Omni model, contributing to its computer-use capabilities.