论文
AutoVQA-G:用于自动视觉问答和基础注释的自我改进代理框架
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
摘要
高质量视觉问答与基础(VQA-G)数据集的手动注释将视觉问题与证据基础配对,对于推进视觉语言模型(VLM)至关重要,但仍然无法扩展。现有的自动化方法通常受到两个关键问题的阻碍:(1)由于模型幻觉导致数据保真度不一致; (2)基于简单启发式的脆弱验证机制。为了解决这些限制,我们引入了 AutoVQA-G,这是一种用于自动 VQA-G 注释的自我改进代理框架。 AutoVQA-G 采用迭代细化循环,其中一致性评估模块使用思想链 (CoT) 推理进行细粒度视觉验证。根据此反馈,记忆增强的提示优化代理会分析来自失败样本的批评,以逐步完善生成提示。我们的实验表明,与领先的多模态 LLM 相比,AutoVQA-G 生成的 VQA-G 数据集具有卓越的视觉定位精度,为创建高保真数据以促进更强大的 VLM 训练和评估提供了一种有前景的方法。代码:https://github.com/rohnson1999/AutoVQA-G