论文
FocusVTC:具有自适应分辨率的高效高性能视觉文本压缩
FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
摘要
大语言模型中的长上下文推理会产生大量的计算和内存成本。视觉文本压缩 (VTC) 通过将文本渲染为图像来减少输入长度,但固定分辨率渲染会产生压缩性能权衡:低 DPI 以牺牲易读性为代价节省标记,而高 DPI 将标记花费在不相关的内容上。我们推出了 FocusVTC,它通过自适应分辨率打破了这种权衡,同时保留了一般的多模态功能。它将压缩的低 DPI 全局视图与选择性区域增强相结合,将增强的视图集成到持续的推理中。我们构建了 29.4K 个高质量推理证据定位 (REL) 思想链示例 (REL-CoT),将推理轨迹链接到页面索引和边界框。多分辨率 REL 监督微调 (REL-SFT) 教会模型定位相关区域,组相对策略优化学习何时增强分辨率以及如何使用结果观察结果,而无需单独的连续预训练阶段。在 RULER v1 上的 72 DPI 下,FocusVTC 在 $2.9\times$ 输入压缩(包括工具观察)下得分为 87.4,而 Glyph 在 $3.0\times$ 输入压缩下得分为 57.5。它超越了 LongBench 上的文本输入主干(56.40 与 55.86),将 MRCR 宏观平均值提高了 13.91 点,并在 VTCBench 上达到了 51.19 的宏观平均值。 MRCR 延迟评估还显示,在线端到端加速比文本提高了 2.79 倍。一般多模态能力得到保留,MMMU从65.12增加到66.73,MME从2424.02增加到2457.62。