论文

MT-Web2Code:多回合区域重建和局部修改的基准 编码智能体

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

智能体系统Agent任务评测

摘要

大型视觉语言模型 (LVLM) 的最新进展展示了 Web UI 生成方面令人印象深刻的功能。然而,现有的基准主要关注从头开始的单轮全页生成,忽略了现实世界前端工程的迭代工作流程,其中开发人员反复重建缺失区域并修改现有代码库中的本地化元素。为了弥补这一差距,我们引入了 MT-Web2Code,这是第一个用于多回合宏观区域重建和微观局部修改的多模态编码基准,其中包含跨越 16 个垂直领域的 102 个任务。为了构建确定性修复轨迹,而不需要昂贵的轮级人工注释,我们开发了一个可扩展的反向损坏轨迹引擎,它可以迭代地将结构和风格缺陷注入标准页面。我们进一步提出了一种双轴评估协议,用于测量目标区域保真度和未受影响内容的保留,其中区域重建通过基于 5 维 VLM 的规则进行评估,并通过确定性像素对齐进行局部修改。对 13 个前沿 编码智能体 进行的实验表明,当前的智能体很难在保留不受影响的内容的同时忠实地重建目标区域,缺乏用于本地编辑的细粒度视觉代码对齐,并且会在多个回合中遭受滚雪球般的错误。除了基准测试之外,我们的确定性评估指标还提供了细粒度的反馈信号,可以促进未来关于训练迭代 UI 编码智能体 的研究。我们的评估代码和数据很快就会发布。