论文

DocPrune:通过背景、问题和理解性标记修剪实现高效的文档问答

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

模型推理推理加速

摘要

视觉语言模型的最新进展在各种多模式任务中表现出了卓越的性能,包括利用文本、表格和图形中的结构化视觉线索进行文档问答。然而,与自然图像不同,文档图像包含大背景和稀疏支持证据,导致大量计算资源的低效消耗,尤其是对于长文档。我们观察到,现有的自然图像和视频的标记减少方法在利用文档特有的结构稀疏性方面存在不足。为了解决这个问题,我们提出了 DocPrune,一个 无需训练 和渐进式文档标记修剪框架,旨在高效地理解长文档。所提出的方法仅保留任务的基本标记,同时删除不必要的标记,例如背景或与问题无关的标记。此外,它会根据模型的理解水平自动选择适当的层来启动标记修剪。我们在 M3DocRAG 上的实验表明,DocPrune 将编码器和解码器的吞吐量分别提高了 3.0 倍和 3.3 倍,同时将 F1 分数提高了 +1.0,无需任何额外的训练即可实现更高的准确性和效率。