论文

一张表值64个token:面向多表文档问答的像素级压缩

A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering

上下文与知识上下文工程

摘要

回答真实世界文档的问题需要处理文本与表格交织的长输入。将上下文表示为图像的光学上下文压缩有望降低token成本,但其对表格理解的影响仍不清楚。我们研究多表文档问答中的像素级表格压缩,在两个基准和五个视觉token预算下评估五个VLM。将表格以原生分辨率表示为图像,在性能和效率上都与文本相当,但缩小表格会使模型用更长、效果更差的推理轨迹来弥补可读性损失,抵消了预期的节省。然而,高度缩小的表格仍保留了足以判断其是否与问题相关的信号。我们利用这种不对称性提出一种免训练的两步法:模型先从像素压缩的上下文中识别回答问题所需的表格,再以原生分辨率对这些表格进行推理。在长文档上,我们的方法节省41%的总token,并比使用原生分辨率表格的单步问答提高7个准确率点。它还比最高效的单步压缩配置少用15%的token,且没有准确率损失。

一张表值64个token:面向多表文档问答的像素级压缩:论文配图
图1:我们的两阶段“先识别、后推理”方法。阶段 1:模型接收文档,其中每张表格都被压缩到较小的视觉 token 预算内,模型不作回答,而是识别出它需要的表格。阶段 2:以原生分辨率提供被识别的表格,模型在其上进行推理以作答。