论文
布鲁斯:腐败升级下的稳健性基准测试,用于科学视觉语言推理
BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning
摘要
由于输入图像质量低或变化,视觉语言模型 (VLM) 在现实情况下经常遇到鲁棒性问题。在本文中,我们旨在通过对输入图像应用扰动和失真(例如模糊或低对比度)来分析 VLM 的鲁棒性。为了实现这一目标,我们提出了 BRUCE(腐败升级下的稳健性基准),这是一种用于科学视觉语言推理的多模态推理脆弱性框架。最先进的评估框架/研究主要关注干净任务的准确性,很少分析推理稳定性如何在鲁棒性维度上降低。除了在大范围的输入扰动下变化之外,BRUCE 还采用了两个新颖的指标——鲁棒性损坏指数(RCI)和遍历 RCI(T-RCI)——来量化随着渐进扰动缩放下视觉损坏严重性的增加,VLM 中多模态推理性能恶化的速度。我们跨多个数据集的化学和数学推理任务评估 BRUCE,同时根据四个高级推理领域分析腐败引起的预测失败:OCR 依赖推理、空间推理、符号推理和语义失败,每个领域都包含细粒度腐败特定的失败子类型,从而实现可解释的失败分析。