论文
视觉文本压缩作为测量传输
Visual Text Compression as Measure Transport
摘要
视觉文本压缩 (VTC) 通过将文本渲染为图像并使用视觉语言模型重新编码来实现高效的长上下文处理,通常产生的解码器标记比子词标记化少 3$--$20\times$。然而,词元节省并不能按预期转化为下游效用:在某些任务上,视觉路径匹配或超过文本路径,在其他任务上,它会崩溃,并且压缩比本身并不能预测将发生哪种情况。因此,缺失的数量并不是效率的另一个总结,而是视觉编码引起的任务相关信息丢失的原则性衡量标准。我们通过用度量传输语言制定 VTC 来解决这个问题。将文本和视觉标记视为经验概率度量,我们表明 ViT 补丁编码器会产生一个前推映射,其传输成本分解为补丁内聚合的精度成本和跨补丁碎片的覆盖成本。这两项都可以通过下游无标记探针进行估计。这种公式产生两个操作结果:下游无标签路由标准,选择是否对给定输入或基准实例使用视觉路径;以及传输通知的注视点机制,以更高分辨率重新编码高成本区域。在 Qwen3-4B 的 $24$ NLP 数据集上,我们的无标签规则与 $17/24$ 数据集 ($70.8\%$) 上的每个数据集预言相匹配,并且相对于纯 LLM,平均任务分数提高了 $+3.3\%$,平均标记为 $-10.3\%$。