论文
揭示视觉文本风格对大型视觉语言模型生成的基于属性的描述的影响
Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
摘要
当考虑文本的视觉风格时,可以观察到字体、颜色和大小的多种变化。然而,当一个单词被阅读时,它的含义与它的书写或翻译风格无关。在本文中,我们研究了图像中单词的可视化风格是否以及如何影响大型视觉语言模型 (LVLM) 为该单词所指概念提供的描述。具体来说,我们研究功能性文本样式(面向可读性,例如黑色无衬线)与装饰性样式(面向显示,例如彩色草书/脚本)如何影响 LVLM 在概念属性方面对概念的描述。我们的实验研究了 LVLM 能够正确识别视觉文本(即呈现为图像的一个或多个单词)所引用的概念的情况,并且视觉文本样式不应影响 LVLM 生成的基于属性的描述。我们的实验结果表明,即使正确识别了概念,文本样式也会影响模型基于属性的概念描述。我们的研究结果证明了从文本样式到语义推理的不平凡的样式泄漏,并激发了基于 LVLM 的多媒体系统的样式感知评估和缓解。