论文

EvoGenUI-Bench:评估大语言模型作为多轮生成式界面助手的能力

EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants

智能体系统Agent任务评测

摘要

大语言模型可以生成交互式 Web 界面,但可靠的生成式 UI 需要随着用户请求的发展而维护可执行工件。我们推出了 EvoGenUI-Bench,这是一个多轮界面维护基准,包括 150 个五轮任务和 750 个轮次,涵盖三种场景:信息呈现、可执行交互和基于工具的外部状态。我们在浏览器中执行生成的工件,并使用屏幕截图、源和 DOM 证据、参与者跟踪和运行时日志对其进行评估。除了转弯级别和剧集级别的成功之外,我们还通过相邻通行保留来衡量交叉转弯保留。在八个模型中,即使是最强的也能达到 74.9% 的回合通过率,而五回合的回合仅完成 37.3%;基于工具的任务的 APR 进一步下降至 52.4%。诊断分析表明,呈现故障集中在信息架构上,交互故障集中在派生状态传播和可供性绑定上,而基于工具的故障还涉及外部状态基础和需求分解。这些结果重新构建了生成式 UI 评估,从判断独立输出到测试界面行为、派生状态、外部状态和辅助声明是否随着工件的发展保持同步。

EvoGenUI-Bench:评估大语言模型作为多轮生成式界面助手的能力:论文配图
图1:多转式文物维护。该模型不是创建独立的网页,而是随着用户要求的演变,反复更新一个单一可执行界面。每次更新都必须执行当前要求,保持依然有效的要求,并保持接口行为、可见状态和相应的回应与对话历史保持一致。