论文

DeepRead:面向增强Agentic搜索的文档结构感知推理

DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search

上下文与知识检索增强

摘要

随着工具使用和代理大语言模型(LLM)的快速发展,检索增强生成(RAG)正在从一次性、被动检索发展为多轮、决策驱动的证据获取。尽管在开放域设置中取得了很好的成果,但现有的代理搜索框架通常将长文档视为块的平面集合,未充分利用文档本机先验,例如层次结构和顺序话语结构。我们引入了 DeepRead,这是一种结构感知、多轮文档推理代理,可以显式地操作这些先验以进行长文档问答。 DeepRead 利用基于 LLM 的 OCR 模型将 PDF 转换为保留标题和段落边界的结构化 Markdown。然后,它在段落级别对文档进行索引,并为每个段落分配一个编码其节标识和节内顺序的坐标样式元数据键。在此表示的基础上,DeepRead 为大语言模型配备了两个补充工具:一个检索工具,可本地化相关段落,同时公开其结构坐标(使用轻量级扫描上下文);以及一个 ReadSection 工具,可在指定的部分和段落范围内进行连续、保留顺序的阅读。我们的实验表明,DeepRead 在文档问答方面比 Search-o1 式代理搜索取得了显着改进。检索和阅读工具之间的协同效应也得到了验证。我们的细粒度行为分析揭示了一种类似于人类“定位然后阅读”行为的阅读和推理范式。

DeepRead:面向增强Agentic搜索的文档结构感知推理
图2。这是DeepRead框架图。它以被解析为Doc Schema的用户问题作为输入。LLM使用检索和阅读工具对文档进行推理和思考。