论文

Desktop-Delta Bench:计算机使用模型理解桌面GUI状态转移吗?

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

计算机使用智能体(CUA)越来越多地通过桌面GUI执行操作以完成长程任务。当前基准主要度量端到端任务成功或单帧定位。两者都无法孤立地检验模型能否重建由某一动作产生的因果性、与任务相关的状态转移——这对拒绝过时观测、验证进展以及从失败中恢复至关重要。这之所以困难,是因为推理、远程输入、应用渲染与截图捕获是异步的:下一观测可能延迟、被遮挡、瞬态或无关,随后被误读为进展并带入后续规划。我们提出Desktop-Delta Bench(DDB),一个离线步级基准,包含来自约15个应用、50个任务领域的新型多应用Linux轨迹的2,013个人工核验实例。DDB轨迹通过2个互补任务瞄准3个失败维度——状态验证、来源追踪与情境感知控制:463个3帧时序排序实例(其中105个含跨轨迹干扰项),以及由5种动作及其载荷标注的1,550对前后对比对。我们在32个排序与16个单动作设置下评估8个闭源与开源模型家族,观察到一致的差距。排序任务尚未饱和:非干扰项与干扰项的最佳精确匹配率分别为65.1%与65.7%。任务上下文使干扰项识别提升6.9个百分点,但使非干扰项精确匹配下降2.2个百分点;错误分析揭示了对所呈现A-B-C顺序的系统性照抄。单动作结果表明,推断动作类别比定位动作更难:点击F1为0.96,而拖拽为0.76,同时被识别出的拖拽通常定位良好。因此,DDB填补了GUI定位与最终任务成功之间缺失的诊断层,补充了端到端基准,使桌面CUA的验证、可靠性与恢复能力得以针对性改进。