论文

SEER:通过选择性视觉文本压缩进行长上下文推理

SEER: Long-Context Reasoning via Selective Visual-Text Compression

上下文与知识上下文工程

摘要

由于文本标记注意力的二次复杂度,对于 大语言模型 来说,长上下文推理的计算成本仍然很高。视觉文本压缩提供了一种有前途的替代方案,它将文本渲染为图像并使用视觉语言模型对其进行处理,通常可以减少词元的使用。然而,现有方法无论查询相关性如何都应用统一压缩,这可能会牺牲需要详细提取的精度。我们提出了 SEER,这是一个框架,它学习通过视觉扫描选择与查询相关的图像,并仅在需要时检索文本内容,将视觉压缩的效率与基于文本的推理的精度结合起来。通过工具交互轨迹上的监督 微调,SEER 学习用于选择和检索的自适应工具调用。长上下文基准测试表明,SEER 通过选择性文本检索提高了提取精度,同时保持相对于全文基线的平均提示标记节省。在 LongBench 上,SEER 的平均准确率达到 51.11%,比视觉文本基线 Glyph-9B 好 2.33 分,比 Qwen3-8B 好 3.49 分。代码可以访问https://github.com/jiaweixu98/SEER