论文

超越任务完成:训练有能力且安全的计算机使用代理

Beyond Task Completion: Training Capable and Safe Computer-Use Agents

模型训练监督微调与指令调优

摘要

计算机使用代理(CUA)在通过图形用户界面完成复杂任务方面取得了快速进展,但仅以任务成功为中心的后训练并不能产生可靠的安全行为。可靠的 CUA 必须以风险为条件来执行:它应该完成普通的良性任务,避免环境危害,并在安全完成路径仍然存在时继续,而在目标有害或不存在安全路径时拒绝。为了学习这种有条件的策略,我们开发了策略执行的安全和能力优化(SCOPE),它联合对 CUA 进行后训练,以提高任务执行能力和安全意识决策。为了为此联合目标提供一致的训练数据,我们进一步引入了 SCOPE-Gen,这是一个自动化管道,可以综合可验证的能力任务并将其转换为配对的环境风险变体,同时保留其原始目标。使用生成的任务,我们构建了 SATraj-OS,这是一个包含功能演示、安全延续和明确拒绝的轨迹数据集。 SCOPE 首先通过监督微调学习所有三种轨迹类型,然后通过在线强化学习进一步提高任务完成度。从 Qwen3.5-9B 开始,SCOPE-RL 在 OSWorld 上实现了 54.17% 的任务成功率,在 OS-BLIND 上实现了 64.30% 的攻击避免率,在评估的代理中产生了最好的综合能力——安全得分为 58.80%。消融揭示了两种形式的安全监管的不对称但互补的作用:拒绝轨迹占攻击避免收益的大部分,而风险处理轨迹在可比攻击避免水平上保留了更大的任务效用。