论文
DocArena:将原始文档转变为文档搜索代理的可控训练环境
DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents
摘要
最近的方法通过从(问题、答案、证据)元组中进行强化学习来训练搜索代理,而不需要专家轨迹。元组充当训练环境,其属性直接决定代理可以开发的搜索策略和泛化能力。虽然之前的工作在提高训练数据质量方面取得了令人鼓舞的进展,但现有环境仍然主要基于文本,并且现有方法可能难以构建可控、可扩展并考虑多模式数据的训练环境。鉴于此,我们提出了 DocArena,这是一个完全自动化的数据管理管道,建立在多模式文档搜索和问答的实际需求之上。它将原始文档集合转换为搜索代理的训练环境,无需任何人工注释。该管道首先通过基于 MLLM 的视觉感知来构建和索引文档,然后分析并利用跨页面信息分布来构建推理密集型 QA 对,并通过 MLLM 执行级联质量保证操作。我们引入了 DocArena-79K,其中包含来自 16 个领域和 49 种语言的 8,336 个文档的 QA 对。我们进一步设计了一个文档搜索代理基础设施,将视觉感知与策略模型解耦,允许基于文本的 LLM 作为多模式文档检索和 QA 的推理支柱。在仅策略模型不同的统一评估框架下,对六个多模态文档场景和七个基于文本的 QA 基准的实验表明,在 DocArena 数据上训练的代理在检索准确性和 QA 质量方面均取得了最佳性能。对智能体搜索行为的进一步分析证实了所构建训练环境的有效性和可控性。