论文

InteractWeb-Bench:多模态智能体能否在交互式网站生成中摆脱盲执行?

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

智能体系统Agent任务评测

摘要

随着多模态大语言模型(MLLM)与编码智能体的进步,网站开发已从人工编程转向基于智能体的项目级代码合成。现有基准依赖理想化假设,尤其是结构良好、信息丰富的输入以及静态执行环境的设定。相比之下,现实开发受制于一个关键瓶颈:来自非专业用户的含糊、低质量指令与模型理解之间的语义错位,这导致一种我们称为盲执行的失败模式。为弥合这一差距,我们提出InteractWeb-Bench,首个面向非专业低代码用户条件下网站生成的多模态交互式基准。InteractWeb-Bench引入四类用户智能体和基于人设的指令扰动,依托需求工程缺陷分类法,系统性地模拟歧义、冗余与矛盾等多样用户行为。我们为智能体开发了交互式执行环境,提供由Clarify、Implement、Verify与Submit组成的统一动作空间,支持迭代式的意图澄清、代码合成与基于视觉反馈的验证。大量实验与分析表明,前沿的基于MLLM的智能体仍深陷盲执行,暴露出意图识别与自适应交互方面的局限。

InteractWeb-Bench:多模态智能体能否在交互式网站生成中摆脱盲执行?:论文配图
图1:InteractWeb-Bench总体架构,轨迹含推理、澄清、实现、验证、提交五类动作,检验智能体是否盲执行。