论文

更加关注高分辨率 MLLM 中的文本

Pay More Attention To Text In High-Resolution MLLMs

上下文与知识上下文工程

摘要

高分辨率 MLLM 的失败通常归因于视觉问题,需要进行缩放、裁剪和相关视觉干预来恢复细粒度证据或抑制干扰。然而最近的研究表明,相关的视觉证据已经编码在中间表示中,这表明仅视觉方面的改进是不够的。这就提出了一个自然的问题:剩下的瓶颈是否在于指导视觉搜索的文本?我们发现了一个以前被忽视的语言瓶颈:为回答而制定的问题不一定指定本地化所需的视觉证据。为了解决这种不匹配问题,我们引入了 EviSpec,这是一种无需训练的编译器,它可以导出补充证据规范,同时保留原始问题以进行最终推理。我们通过匹配控制实验进一步验证它,这些实验分离了证据规范和定位的作用。在搜索预算固定的情况下,结构化证据规范比一般请求产生 8.6% 的相对收益。在证据几何匹配的情况下,EviSpec 定位的证据比随机证据产生 14.8% 的相对增益。总之,这些控制措施隔离了指定要寻求哪些证据的好处,而不仅仅是扩大视觉访问。在所有五个 MLLM 中,EviSpec 始终在三个基准测试的相应基线上进行改进,在 V\textsuperscript{*}Bench、HR-Bench-4K 和 HR-Bench-8K 上分别产生 \textbf{10.4%、8.8% 和 12.4%} 的平均相对增益。除了高分辨率推理之外,EviSpec 还在 VQA 和针对幻觉的基准测试中实现了最先进的性能。