论文

See, Plan, Snap:在Scratch中评估多模态GUI智能体

See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch

智能体系统Agent任务评测

摘要

以 Scratch 为代表的积木式编程环境在低代码教育中扮演核心角色,但评估 AI 智能体通过图形用户界面(Graphical User Interface,GUI)构建程序的能力仍研究不足。我们提出 ScratchWorld,一个在 Scratch 中评估多模态 GUI 智能体完成程序构建任务的基准。ScratchWorld 以“使用-修改-创造”(Use-Modify-Create)教学框架为基础,包含 83 个精选任务,覆盖四类不同的问题类别:Create、Debug、Extend 和 Compute。为严格诊断智能体失败的来源,该基准采用两种互补的交互模式:原始模式(primitive mode)要求细粒度的拖放操作,以直接评估视觉运动控制;复合模式(composite mode)则使用高层语义 API,将程序推理与 GUI 执行解耦。为确保评估可靠,我们提出基于执行的评估协议,通过浏览器环境内的运行时测试验证所构建 Scratch 程序的功能正确性。跨最先进多模态语言模型与 GUI 智能体的大量实验揭示了显著的“推理—行动”差距,表明尽管规划能力强大,细粒度 GUI 操作仍是持续的挑战。

See, Plan, Snap:在Scratch中评估多模态GUI智能体
图1:通过一个 Debug 任务展示 ScratchWorld 评估流程概览:修复 Pong 中不正确的挡板控制。智能体通过两种模式进行交互:使用 GUI 操作(拖放)的原始模式(primitive mode),或使用高层 API(删除积木块)的组合模式(composite mode)。基于执行的评估利用 Scratch VM 来验证功能正确性。