论文

迈向可验证的多模式深度研究:用于交错报告生成的多代理工具

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

智能体系统Agent Harness

摘要

大语言模型 (LLM) 拥有先进的自主代理,从检索简明事实答案的深度搜索到将分散的证据合成为长篇报告的深度研究。然而,由于没有确定性 真值 的开放式综合以及需要将文本论证与视觉证据交织在一起,可验证的多模态深度研究仍然具有挑战性。我们提出了 Ptah,一种用于交错报告生成的多代理工具。 Ptah 通过规划、研究和编写阶段来协调从用户查询到呈现的 Web 报告的生命周期,其中专门代理构建视觉感知计划,收集基于声明的证据,在视觉工作记忆中维护源对齐图像,并通过使用声明性多模式工具撰写报告。验证者代理充当Harness的接受功能,在整个工作流程中强制执行事实依据、引文保真度和跨模式一致性。我们进一步介绍 PtahEval,这是一种评估协议,通过图像级和演示级评估来增强现有基准。深度研究基准的实验表明,与强大的基准相比,Ptah 生成的报告更可靠、更具视觉信息、更可用、更人性化的多模式报告。我们的代码发布于 https://github.com/SnowNation101/Ptah