论文

DocIntent:真实世界文档视觉问答的可回答性引导代理恢复

DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering

智能体系统Agent 架构与控制循环

摘要

模糊、阴影、扭曲和莫尔图案等现实世界的退化严重损害了 Multimodal 大语言模型 (MLLM) 的文档问答功能。在视觉问答 (VQA) 之前应用恢复工具是一种直观的解决方案。然而,现有的恢复方法仍然有限,因为手动设计和执行恢复策略是劳动密集型的,并且需要领域专业知识。代理恢复为自动化提供了新的可能性,但现有框架主要针对自然图像并追求感知质量,忽视了恢复应该服务于下游任务而不是优化通用图像质量指标。为此,我们探索了代理恢复对于现实世界降级文档 VQA 的价值,并提出了 DocIntent,一个 无需训练 Answerability-Guided Agentic Restoration 框架。 DocIntent 首先评估问题的可回答性,然后识别与任务相关的降级并有选择地调用恢复工具。基于比较的回滚机制验证每个恢复步骤,并在与问题相关的证据变得难以辨认时恢复它。整个过程不需要额外的预训练退化分类器或图像质量评估模型。 WildDoc 基准测试的大量实验表明,DocIntent 持续提高了不同开源和闭源 MLLM 的平均分数和一致性。代码和实验数据将公开。