论文
BEiTScore:使用高效交叉编码器模型进行无参考图像描述评估
BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model
摘要
图像字幕评估仍然是一个重大挑战,因为视觉语言模型朝着更具挑战性的能力发展,例如生成长格式和上下文丰富的描述。最先进的评估指标涉及与使用 大语言模型 (LLM) 作为评判相关的大量计算成本,或者受到基于标准 CLIP 的编码器的限制,例如严格的标记限制、缺乏细粒度的敏感性,或者通过将标题视为“词袋”而缺乏组合泛化。我们提出了一种新的学习指标,可以基于轻量级模型来解决上述挑战。从视觉问答模型检查点初始化的交叉编码器,平衡强大的权重初始化与计算效率。我们的训练方案使用精心组装的数据混合物进行监督学习,具有基于 LLM 的对抗性数据增强功能,以增强模型对细粒度视觉语言错误的敏感性。我们还引入了一个新的基准,旨在评估不同场景下的详细字幕评估。实验结果表明,所提出的指标实现了最先进的性能,同时保持了大规模基准测试、质量感知解码或奖励指导所需的效率。