论文

DocAtlas:作为可变状态交互的长文档理解

DocAtlas: Long-Document Understanding as Mutable-State Interaction

智能体系统Agent Harness

摘要

长文档理解需要模型在多个页面、布局、表格、图形和图表中查找和组合证据。现有的检索增强系统通常在生成之前从静态索引中选择证据,而最近的代理系统增加了多轮工具的使用,但通常依赖于冻结的专有主干,其行为由提示设置。我们推出了 DocAtlas,这是一个将长文档理解视为可变状态信息查找过程的系统。我们将 DocAtlas 实例化为可变文档工具:一个外部环境,决定在每个步骤中搜索、读取、存储、审查和向模型显示哪些文档信息。给定文档和问题,该工具会公开搜索、阅读、笔记和审阅工具,维护分层树和笔记存储,并在代理记录证据时更新两者。 DocAtlas 在固定的上下文预算下结合了自我改进检索、选择性证据访问和主动工作记忆。相同的工具支持大型 VLM 的推理时间使用以及紧凑型 VLM 代理的端到端强化学习。使用 GPT-5.4,DocAtlas 在 MMLongBench-Doc 上达到 71.4%,超过了人类专家参考值 65.8%。在 DocAtlas 环境中使用端到端 RL 训练的 Qwen3.5-4B VLM 达到 63.7%,而直接输入基线为 54.4%,这表明可变文档Harness设计可以大幅改进紧凑文档代理。