论文

CapRiCorn-1K:跨时间尺度的视频描述和主体指代一致性的综合基准

CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales

模型评测基准与评测资源

摘要

准确、全面的视频描述以及一致的主题参考对于下游理解和生成任务至关重要。然而,现有的基准很少能够客观、全面地评估不同时长和场景的这些属性,从而阻碍了视频描述模型的进步。为了弥补这一差距,我们提出了 CapRiCorn-1K,这是一个综合基准测试,旨在评估长期时间范围和不同视频领域的视频描述质量和主体指代一致性。为了满足不同的评估需求,我们的基准测试支持视听和仅视觉设置。 CapRiCorn-1K 上的大量实验表明,当前模型通常难以生成准确且全面的字幕,同时保持一致的主题参考。此外,随着视频时长的增加,整体字幕质量和主体指代一致性都会下降。值得注意的是,我们的评估指标与下游理解和生成任务的性能表现出很强的相关性,这进一步验证了它们的有效性。该项目位于 https://github.com/xlchen0205/CapRiCorn-1K 。