论文
RoboStressBench:针对具体场景中的物理视觉压力对 VLM 鲁棒性进行基准测试
RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes
摘要
视觉语言模型(VLM)已经表现出强大的视觉理解能力,并且越来越多地部署在具体的人工智能系统中,在这些系统中,真实条件下的可靠感知至关重要。然而,现有的基准测试使用干净的图像或孤立的扰动而不是物理场景形成引起的压力来评估 VLM。这种设计有两个局限性:它仅涵盖日常视觉压力的一小部分,并且一些扰动很少出现在现实的具体场景中。这一差距提出了一个基本问题:我们如何以原则性的方式定义视觉压力,以捕捉物理环境中遇到的各种因素?为了解决这个问题,我们从逆图形角度制定视觉感知,并引入 RoboStressBench,这是一个评估 VLM 对具体场景中物理视觉压力的鲁棒性的基准。受物理渲染方程的启发,RoboStressBench 将视觉压力分解为四个物理维度:材质 (M)、视点 (V)、光照 (L) 和几何 (G)。这种设计使 RoboStressBench 能够涵盖现实环境中的各种视觉压力,同时允许对其对 VLM 功能(例如视觉识别、推理和规划)的影响进行受控分析。通过对最先进的 VLM 进行综合评估,我们识别了特定于应力的失效模式,并揭示了不同的物理因素会降低不同的体现能力,而这些能力往往被总体精度所掩盖。我们进一步引入了一种压力感知代理求解器,可以在推理之前检测视觉压力源并调用视觉编辑技能,从而提高高压力场景下的鲁棒性。总体而言,RoboStressBench 提供了一个原则性的评估框架,用于诊断和改善现实世界身体压力下的 VLM 感知,支持开发更可靠的实体 AI 系统。