论文
MLLM能“读”出缺失的内容吗?
Can MLLMs "Read" What is Missing?
摘要
我们提出MMTR-Bench,一个旨在评估多模态大语言模型(MLLM)从视觉上下文中直接重建被遮蔽文本的内在能力的基准。与传统问答任务不同,MMTR-Bench取消了显式提示,要求模型从文档、网页等真实领域的单页或多页输入中恢复被遮蔽的文本。这一设计将重建任务与指令遵循能力解耦,从而可以直接评估模型的版面理解、视觉定位(visual grounding)与知识整合能力。MMTR-Bench包含2,771个测试样本,覆盖多种语言和不同的目标长度。为兼顾这种多样性,我们提出一个层级感知的评估协议。在代表性MLLM上的实验表明,该基准极具挑战性,尤其是句子级和段落级重建。主页见 https://mmtr-bench-dataset.github.io/MMTR-Bench/。
