论文
InSight:交互式可视化中代理声明验证的基准
InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations
摘要
视觉语言模型在解释静态视觉伪影方面表现出了非凡的能力,但现代数据分析本质上是动态的,需要主动询问交互式环境。现有的基准主要局限于静态图像和一次性问答,无法捕捉该领域的认知需求,其中证据经常被遮挡、分布在链接的视图中或通过用户代理有条件地显示。在本文中,我们介绍了 InSight,这是通过交互式可视化进行代理声明验证的基准。该数据集包含 21,349 条主张,这些主张源自人类撰写的分析叙述,并基于完全交互式的网络环境。代理必须在这些环境中进行导航,以确定在现有证据的情况下,自然语言主张是否得到支持、反驳或无法验证。与传统评估不同,InSight 将交互痕迹视为推理的内在代理,从而能够对模型如何寻找和合成视觉证据进行严格审核。我们评估了最先进的模型,表明交互式验证仍然是一个不小的挑战。我们在 https://github.com/maevehutch/insight 发布了 InSight。