论文

DashArena:首个评测大语言模型交互式分析仪表盘生成的基准

DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

模型评测基准与评测资源

摘要

分析仪表盘通过协调组合的多个视图与交互来支持数据探索和决策。近期的模型可以从数据和自然语言目标生成仪表盘,但评估其实用性仍然困难。仪表盘生成是开放式的,仅凭静态外观或成功执行都不足以刻画分析支持能力与交互质量。我们提出DashArena,据我们所知这是首个面向开放式、任务锚定的交互式分析仪表盘生成基准。其关键创新是要求每个系统同时生成一个仪表盘和一条可回放的交互轨迹。浏览器执行器回放该轨迹,将系统预期的分析工作流转化为可复现的视觉与执行证据。一个VLM裁判利用这些证据比较候选者,并通过Bradley–Terry聚合产生排行榜。我们进一步将该裁判蒸馏为开放权重的DashJudge-8B。人类评估表明,DashJudge-8B能有效复现人类判断;消融实验表明,交互证据提升了裁判的一致性。对前沿模型的实验揭示了持续存在的渲染、分析与交互缺陷。这些结果共同表明,贴近现实的仪表盘生成仍然具有挑战性,而交互感知的评估能够捕捉静态或仅执行检查所遗漏的失败。

DashArena:首个评测大语言模型交互式分析仪表盘生成的基准:论文配图
图1:DashArena概览。人工编写的仪表板提供真实的任务种子。每个被评估模型生成一个仪表板和一条轨迹;浏览器执行把该轨迹转化为确定性的证据。VLM裁判对匿名候选进行比较,任务聚类的Bradley–Terry聚合产生最终排行榜。