论文
先见后同意:将多代理共识与视觉证据结合起来
Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
摘要
视觉语言模型(VLM)在视觉问答(VQA)方面取得了出色的性能。为了减轻个人的幻觉和盲点,通过多智能体协作聚合不同的观点已成为一种有前途的范例。虽然这种方法在文本质量保证方面取得了巨大成功,但其在多模态领域的潜力仍未得到充分开发。现有的多智能体 VQA 方法主要采用以文本为中心的协议,注重文本讨论,而忽略视觉信息的对齐。在这项工作中,我们揭示了一个关键见解:答案级别一致性不足以实现可靠的多智能体 VQA; \textit{对齐的视觉证据}——智能体所依赖的图像区域的共享支持——对于达成值得信赖的共识至关重要。为了利用这一见解,我们提出了 EAGLE (\textbf{E}vidence-\textbf{A}ligned \textbf{G}rounded mu\textbf{L}ti-agent r\textbf{E}asoning),这是一个用于协调多个 VLM 代理的 无需训练 以证据为中心的框架。 EAGLE 明确地将每个智能体的定位区域公开为视觉证据,实现证据的相互验证,并使用证据一致性来指导最终决策。对六个 VQA 基准的实验表明,EAGLE 在跨领域实现了最佳平均性能,同时保持轻量级、可解释性和部署实用性。