论文

DREAM:多模态多智能体辩论的动态分辨率分配

DREAM: Dynamic Resolution Assignment For Multimodal Multi-agent Debate

智能体系统Agent 协作

摘要

多智能体辩论 (MAD) 已成为提高大语言模型 (LLM) 推理能力的有效范例,并且越来越多地扩展到多模式设置。然而,现有的多模态 MAD 框架通常将智能体暴露给相同的固定视觉输入,忽略样本和智能体所需的视觉比例的实质性变化。此外,这些框架经常遭受群体思维的困扰,这种现象是智能体过早地放弃正确的推论,以符合自信但幻觉的同行反应。为了解决这些瓶颈,我们引入了 DREAM(多模态多智能体辩论的动态分辨率分配),它通过两个核心组件进行操作:(1)动态分辨率分配,零样本探针回合,其中智能体测试多个分辨率,使用平均归一化对数似然(ANLL)量化不确定性,并使用自适应阈值将每个智能体分配给其经验最佳分辨率; (2) 不确定性引导的回滚聚合通过跟踪每个智能体在轮次中的不确定性并恢复被群体压力覆盖的早期低不确定性答案来对抗群体思维。在六个多模态数据集上,DREAM 将多智能体辩论基线的准确性token权衡提高了 1.5-3.2%,无需针对数据集进行特定调整。

DREAM:多模态多智能体辩论的动态分辨率分配的原论文方法或结果图
图 1:视觉任务需要不同的分辨率:简单的感知任务(左)只需要 $0.5\times$,而 $2.0\times$ 会引入长上下文噪声,从而主动降低准确性。相反,密集图表(右)需要 $2.0\times$ 保留关键的细粒度细节,因此 $0.5\times$ 不可逆地丢弃它们。标准 MAD 使用固定分辨率,在简单样本上性能下降,在复杂样本上失败。 DREAM 通过动态地将每个样本分配到其经验上的最佳规模来解决这个问题。