论文
DREAM:多模态多智能体辩论的动态分辨率分配
DREAM: Dynamic Resolution Assignment For Multimodal Multi-agent Debate
摘要
多智能体辩论 (MAD) 已成为提高大语言模型 (LLM) 推理能力的有效范例,并且越来越多地扩展到多模式设置。然而,现有的多模态 MAD 框架通常将智能体暴露给相同的固定视觉输入,忽略样本和智能体所需的视觉比例的实质性变化。此外,这些框架经常遭受群体思维的困扰,这种现象是智能体过早地放弃正确的推论,以符合自信但幻觉的同行反应。为了解决这些瓶颈,我们引入了 DREAM(多模态多智能体辩论的动态分辨率分配),它通过两个核心组件进行操作:(1)动态分辨率分配,零样本探针回合,其中智能体测试多个分辨率,使用平均归一化对数似然(ANLL)量化不确定性,并使用自适应阈值将每个智能体分配给其经验最佳分辨率; (2) 不确定性引导的回滚聚合通过跟踪每个智能体在轮次中的不确定性并恢复被群体压力覆盖的早期低不确定性答案来对抗群体思维。在六个多模态数据集上,DREAM 将多智能体辩论基线的准确性token权衡提高了 1.5-3.2%,无需针对数据集进行特定调整。
