论文

裁决图像描述:用于严格零样本图像图像描述的多智能体对齐评分和共识蒸馏光束仲裁

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

模型推理推理验证与自校正

摘要

零镜头图像图像描述(ZIC)在图像描述训练期间描述没有配对图像图像描述监督的图像,依赖于纯文本语料库和冻结的预训练图像文本评分器。现有的检索增强方法在检索时对图像文本对齐进行一次评分,然后仅在语言模型概率下提交图像描述者的自回归光束,使解码器没有进一步的视觉基础反馈。进展已经停滞,自 2024 年以来没有任何方法能够改善严格制度的最佳状态。我们提出了 Adjudicated Captioning,这是一种推理时多智能体框架,可以在未更改的 IFCap 图像描述器上恢复多个检查点的图像证据对齐反馈。首先,我们在输入处安装一个更强的冻结检索编码器。其次,在检索和解码之间,我们插入一个冻结的交叉注意力验证器,将前 9 名检索重新排序为前 5 名。第三,在输出光束处,我们附加了一个学习的 Reranker,将 TriFuse(一种多层感知器)与 MemAtend(一种内存管理 Transformer)(管道唯一的学习组件)配对;两者均由 Borda 共识 蒸馏 在三个冻结评分器上进行自我监督训练,不使用配对的图像图像描述标签,也不使用参考图像描述。在归纳图像描述协议下,重新排序器适合不相交的 COCO Karpathy 验证束并应用于冻结测试,该框架在 COCO Karpathy 上达到 CIDEr 117.6 和 SPICE 21.9,高于 IFCap 的 108.0 和 20.3,+9.6 CIDEr 增益,比 NES(最强的合成图像增强方法 109.9)高出 +7.7,而无需重新训练图像描述员。 无需训练 固定融合基线达到 115.8 CIDEr,因此 +9.6 增益中的 +7.8 来自非学习架构干预,其余 +1.8 来自学习重新排序器。相同的配方在没有图像描述重新训练的情况下转移到 COCO 之外:Flickr30k Karpathy 上的 +8.1 CIDEr 和 NoCaps 上的 +5.7 整体。