论文

将语义与视觉解耦:忠实视觉文本压缩评估的框架

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

模型评测评测方法与指标

摘要

最近的视觉文本压缩(VTC)方法,以 DeepSeek-OCR 为代表,通过利用文本到图像渲染,为长上下文建模任务提供了令人印象深刻的高词元压缩率。然而,现有的评估协议严重依赖下游任务的性能。由于多模态 大语言模型 (MLLM) 强大的固有语言先验,此类评估指标无法准确测量文本保存。在这项工作中,我们引入了一个新的评估框架,该框架将 MLLM 的能力解耦,以忠实地评估 VTC 质量。在此框架内,我们进一步引入了ZeroSense Benchmark,以确保测试样本的低语义相关性。通过消除文本依赖性,我们的基准测试保证评估结果纯粹反映 VTC 质量,不受下游模型语义推理能力的影响。跨多个数据集的广泛实验表明,VTC 质量和下游任务准确性存在显着差异,凸显了我们解耦评估框架的必要性。