论文
用锚点思考:扎根且高效的文档推理
Thinking with Anchors: Grounded and Efficient Document Reasoning
摘要
现有的文档理解基准主要集中在定位页面元素,但现实世界的文档智能需要模型对区域语义、空间关系和视觉结构进行联合推理。我们提出了 ADOPD 2026,这是 ADOPD 的面向推理的扩展,它将页面分解转变为基于空间的文档理解。 ADOPD 2026 丰富了从 ADOPD 2024 数据集继承的页面锚点,包括人工校正的区域描述、语义标签和生成的基于文档区域的思想链 (CoT) 跟踪。我们没有将框、掩码和标签视为独立的监督信号,而是将文本块、视觉实体、语义标签、边界框和多边形掩码视为视觉锚点的共享词汇表。该表示支持三种连接功能。首先,区域级语义标记要求模型从页面上下文和本地外观中识别文档元素类型,揭示标准布局基准经常隐藏的长尾语义故障。其次,统一的视觉语言基础生成文本区域和视觉实体以及坐标或多边形轮廓,将检测和分割输出转换为可由下游推理系统重用的结构化锚点。第三,当前最先进的模型仍然难以应对在 DocCount(源自 ADOPD 2026 的基准)上评估的密集计数任务,这凸显了文档语义理解中对 Thinking-with-Anchors 管道的需求。通过将页面分解与可验证的视觉锚点推理连接起来,ADOPD 2026 提供了一个任务框架,使文档理解超越本地化,转向基于锚点的文档智能。