论文

MiniAppBench:评估LLM助手从文本转向交互式HTML响应

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

模型评测基准与评测资源

摘要

随着大语言模型(LLM)在代码生成方面的快速进步,人机交互正从静态文本响应演变为动态、可交互的基于HTML的应用,我们将其称为MiniApp。这类应用要求模型不仅能渲染可视化界面,还要构建符合现实世界原则的定制交互逻辑。然而,现有基准主要关注算法正确性或静态布局重建,未能捕捉这一新范式所需的能力。为填补这一空白,我们提出MiniAppBench,首个用于评估原则驱动、交互式应用生成的综合性基准。MiniAppBench源自一个拥有超1000万次生成记录的真实应用,提炼出横跨六个领域(如游戏、科学和工具)的500个任务。此外,为应对评估无唯一标准答案的开放式交互这一难题,我们提出智能体式评估框架MiniAppEval。它借助浏览器自动化执行类人的探索性测试,从意图(Intention)、静态(Static)和动态(Dynamic)三个维度系统评估应用。实验显示,当前LLM在生成高质量MiniApp方面仍面临显著挑战,而MiniAppEval与人类判断高度一致,为未来研究建立了可靠标准。项目主页见miniappbench.github.io。

MiniAppBench:评估LLM助手从文本转向交互式HTML响应:论文配图
图1:从文本到MiniApp的转变:相较静态文本,MiniApp将抽象说明转为直观可视化,并解锁饮食记录等此前不可行的可操作任务。