论文
GUI-CC:作为代理环境的 GUI 世界模型的上下文一致性基准测试
GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments
摘要
GUI 世界模型越来越多地被评估为一步式下一屏幕预测器,但它们的预期用途通常是作为 GUI智能体 的多步环境。这种不匹配留下了一个未经过测试的关键要求:生成的状态在将来的交互中重复重用时必须保持上下文一致。我们引入了 GUI-CC,这是一个基准,用于评估 GUI 世界模型作为代理环境而不是孤立的下一屏幕预测器的上下文一致性。 GUI-CC 包含两个互补的轨道:一个沿着真实移动 GUI 轨迹滚动模型的离线参考操作轨道,以及一个允许固定探测代理与模型生成的 UI 交互的在线代理循环轨道。我们从 GUIOdyssey 构建了 500 个离线轨迹任务,并在 30 个移动应用程序中构建了 200 个经过模拟器验证的在线任务。 GUI-CC 评估转换保真度、转换合理性、上下文一致性和任务进度。实验表明,看似合理的单步生成并不能保证可靠的环境模拟:当前模型通常会生成看起来可用的屏幕,但无法保留与任务相关的上下文或支持可执行的多步部署。