论文
视觉语言模型中的图表欺骗:从脆弱性到缓解
Chart Deception in Vision-Language Models: From Vulnerability to Mitigation
摘要
信息可视化被广泛用于传达模式、趋势和异常值,但欺骗性的设计选择——如截断或反转的坐标轴、失真的纵横比、不恰当的编码和误导性的颜色映射——可能在保留底层数据的同时系统性地改变解读。随着视觉语言模型(VLM)日益被用于图表理解和分析推理,评估其对这类欺骗性可视化的鲁棒性已成为可信数据分析的关键。我们提出 VisDeception,首个用于评估 VLM 对误导性图表设计鲁棒性的受控配对基准。该基准包含1600对忠实与误导性图表,涵盖八大类欺骗性可视化策略,其中每个误导性图表都与由相同底层数据生成的忠实对应版本配对。为了将欺骗导致的推理错误与基线图表理解错误区分开,我们引入欺骗分数(Deception Score),一种配对评估指标,量化误导性可视化使模型响应偏离数据忠实解释的程度。基于10个最先进 VLM 的32000条响应,我们发现即使先进的模型也仍然极易受到欺骗性视觉操纵的影响。为进一步提升鲁棒性,我们进一步提出一种推理时多智能体缓解框架,在答案生成前将推理锚定到从可视化中抽取的结构化图表元数据上,使模型无需用户显式指令即可减少欺骗性视觉线索的影响。我们的发现共同揭示了当前图表理解系统的重要可靠性缺口,并确立了基准驱动评估、欺骗感知指标和结构化推理作为开发更可信视觉分析 VLM 的有前景方向。
