论文
Exemplar2VQA:通过多Agent编码的可扩展 Exemplar 驱动的视觉问答生成框架
Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding
摘要
复杂、可扩展的 3D 问答 (QA) 数据的稀缺阻碍了多模态大语言模型 (MLLM) 空间智能的发展。虽然手动注释是劳动密集型的,但直接利用大语言模型来合成这些问答对通常会失败,因为它们在空间和几何计算方面存在固有的缺陷。我们引入了 Exemplar2VQA,这是一种可扩展的范例驱动的视觉问答生成框架,可通过多智能体编码在模拟环境中快速合成大规模空间 QA 对。通过为协作Agent配备精心设计的几何实用程序库,Exemplar2VQA 通过确定性代码执行绕过了大语言模型的空间推理缺陷。至关重要的是,该框架表现出了非凡的多功能性:以各种静态的以对象为中心的空间查询模板作为范例,它将它们无缝、自主地缩放为大规模、高保真度的合成数据集。仅在 Exemplar2VQA 生成的合成室内数据上微调 Qwen2.5-VL (3B/7B),可在各种不同的基准测试中产生显着的性能改进。此外,其有效性不仅限于域内室内数据集,还可以稳健地扩展到室外和混合场景基准。这些结果使 Exemplar2VQA 成为一个可扩展且强大的范例,用于弥合 Embodied AI 中模拟与真实的差距。我们的代码位于 https://github.com/yingjiayu12/Exemplar2VQA