论文

DeCoRAG:用于复杂文档理解的认知解耦和语义感知裁剪

DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

上下文与知识检索增强

摘要

推进用于复杂文档理解的多模态检索增强生成(RAG)呈现出准确性和效率的可怕双重困境,特别是在图 RAG 中。处理结构稀疏但视觉密集的布局,例如从财务图表中提取微小的数据标记,通常会产生计算上令人望而却步的词元开销,同时仍然会引发灾难性的幻觉。然而,多模态图 RAG 管道依赖于图构建阶段,这些阶段假设视觉语言模型 (VLM) 可以解析高密度布局中的稀疏语义。我们挑战了这一假设,揭示了迫使 VLM 本地化视觉证据、解释语义和提取关系会触发“视觉注意力池”,这是一种导致灾难性语义丢失的机制,而全页处理会产生大量计算开销。受控干预验证这种失败是边界驱动的而不是特定于内容的,并且语义锚定可以缓解它。为了从根本上纠正这种有缺陷的范式,我们引入了 DeCoRAG,这是一种多模式图 RAG 管道,它将知识处理从耦合的视觉语义推理转变为“认知解耦”。它的图构建阶段不是被动地处理原始像素,而是建立了一个宏观的语义锚来中和注意力沉降。该锚点随后驱动我们的区域感知修剪和裁剪(RAP-Crop)机制,将推理空间从密集、嘈杂的背景转移到纯净的、意图驱动的语义集群。生成的图表支持混合检索和答案生成。在复杂的文档基准测试中,DeCoRAG 将语义通过率比最强基线提高了 12.5 个百分点,并推广到 DocVQA。 RAP-Crop 在不牺牲端到端准确性的情况下将离线图构建提示标记减少了 40.8%。