论文
FORUM:使用视觉grounding模型协议协调冻结输出
FORUM: Frozen Outputs Reconciled Using Model Agreement for Visual Grounding
摘要
冻结的多模态大语言模型 (MLLM) 现在只需一次提示调用即可解决标准引用表达理解,但在具有相同类别干扰项和否定的对抗性基准测试中,即使是最大的模型也肯定是错误的,并且重新采样会重复该错误。根据不同数据和架构构建的模型很少会遇到相同的混杂因素,因此它们的一致性是正确目标的强烈无标签信号。我们提出了 FORUM,一种由两个固定几何规则引导的冻结 MLLM 的免训练测试时融合:基于协议的选择使最独特的模型支持该区域,并且中心点定位返回实际的成员框而不是坐标平均值,因此一个松散的预测无法改变答案。通过融合三个开放式 MLLM,FORUM 在对抗性 Ref-Adv-s 基准上的平均准确度相对于已发布的 397B 参数参考超出了 5%,而普通平均集成则超出了 15%。收益转移到标准 RefCOCO+,并且没有主导成员的平衡阵容仍然超过 397B 型号 5%。