论文
SMSP:MLLM 感知视觉错觉的多尺度感知即插即用策略
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
摘要
最近的研究表明,多模态 大语言模型 (MLLM) 非常容易受到隐藏模式视觉错觉的影响,其中隐藏的内容对于模型来说是难以察觉的,但对于人类来说却是显而易见的。这一缺陷凸显了当前 MLLM 与人类之间的感知偏差,并且还引入了潜在的安全问题。为了系统地研究这一失败,我们引入了 IlluChar,一个全面且具有挑战性的错觉数据集,并揭示了模型失败的关键潜在机制:高频注意力偏差,即模型很容易被错觉图像中的高频背景纹理分散注意力,导致它们忽略隐藏的模式。为了解决这个问题,我们提出了多尺度感知策略(SMSP),这是一个与人类视觉感知策略相一致的即插即用框架。通过抑制分散注意力的高频背景信号,SMSP 生成更接近人类感知的图像。我们的实验表明,SMSP 显着提高了所有评估的 MLLM 在错觉图像上的性能,例如,将 Qwen3-VL-8B-Instruct 的准确性从 13.0% 提高到 84.0%。我们的工作为 MLLM 的视觉感知提供了新颖的见解,并提供了实用且强大的解决方案来增强它。我们的代码可在 https://github.com/Tujz2023/SMSP 上公开获取。