论文
Rigel:用于图像和视频描述评估的自蒸馏分数自适应
Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation
摘要
尽管标准评估指标与人类判断的一致性有限,但图像和视频描述的自动评估对于多模态系统的基准测试至关重要。最近使用 大语言模型 (LLM) 的方法(通常称为 LLM-as-a-Judge)改进了与人类判断的一致性,但仍然存在大词汇量语言建模与小标签集评估之间的不匹配问题。为了解决这个问题,我们提出了 Rigel,一种基于自蒸馏分数适应的图像和视频描述自动评估指标。该指标采用从冻结的 LLM 中提取的特定于评估的评分头,它可以在任务对齐的空间中捕获判断信号,而不依赖于大词汇量标记集。然后,我们用人类判断数据完善 LLM 主干网。为了训练 Rigel,我们构建了 Vid-Lepus 数据集,其中包含 3,338 个视频剪辑、33,380 个参考描述和 5,637 个候选描述。多个基准测试的实验表明,Rigel 的性能优于最先进的指标,在无参考设置中比 ActivityNet-Fact 实现了 10 多点的改进。