论文
图表支持还是模型自供?检验面向无障碍可视化的MLLM生成断言
Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization
摘要
多模态大语言模型(MLLM)能够将可视化模式与外部原因、后果和领域知识联系起来,但这些解释的证据基础往往不清楚。我们对来自四个来源的102个可视化、三个MLLM和四种输入条件开展了探索性研究,这些输入条件改变对图像的访问、可访问图表上下文(数据表、标题、替代文本和读屏器结构等非图像产物)以及扣留上下文的提示设定。在1,224条描述中,我们分析了模型自标的DIRECT、DERIVED和SPECULATIVE标签,并对数值一致性进行了自动审计。可访问图表上下文使Gemini和GPT转向DIRECT断言,并提升了一些模型的数值一致性。在完整上下文基础上加入图像并未带来一致的数值收益,扣留上下文的提示也未能可靠地增加谨慎措辞。提示中定义的“现实世界意义”部分仍以SPECULATIVE为主。这些结果启发构建能够将由所供证据支持的断言与模型自供解释区分开来的无障碍描述系统。
