论文
相同的语义,不同的路径:视觉文本压缩的自我改进对齐
Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression
摘要
视觉文本压缩 (VTC) 将长文本渲染为图像,并通过视觉编码器 (ViT) 对它们进行编码,将数千个文本标记压缩为更少的视觉标记。然而,由于 ViT 主要是在自然图像上进行预训练的,因此它捕获视觉属性(字形、字体大小、布局)而不是语言语义,从而导致渲染图像表示与本机文本表示不同。我们将这种跨路径不一致称为“交叉路径不一致”,并通过渲染扰动实验表明,这是 VTC 的一个关键但被忽视的瓶颈。我们提出了 SPIRAL(自我改进路径集成和重新对齐),这是一种自我监督的对齐框架,仅使用模型自己的文本路径行为作为监督来缩小这一差距,不需要外部教师或额外的注释。 SPIRAL 以两种互补的粒度运行:用于局部 忠实性 的 词元级 同策略 蒸馏 (OPD) 和用于全局一致性的序列级偏好优化 (DPO)。在 VTCBench 上,SPIRAL 将 Qwen3-VL-8B 的总体得分从 35.10 提高到 54.02,接近本机文本输入性能 (55.60),并且性能比模型高出 30 倍。这两种粒度表现出互补的优势:OPD 擅长检索且样本效率高,而 DPO 的推理和记忆能力更强,并且可以更好地扩展数据。 SPIRAL 的优势还可以推广到域外基准测试,确认有效的 VTC 取决于将渲染图像表示与本机文本语义对齐。