论文
OmniCapBench:用于细粒度视听字幕的深层结构评估框架
OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning
摘要
多模态大语言模型(MLLM)正在迅速向连续视听推理发展,迫切需要进行暴露其能力限制的评估。视听字幕是一项理想的诊断任务,但当前的基准面临着双重权衡:整个字幕分数提供了没有本地化的覆盖范围,局部探针提供了没有覆盖的本地化,而不受约束的LLM法官则带来了不稳定。我们推出 OmniCapBench(全视频字幕基准),这是一个将视听字幕评估重新构建为深度结构化诊断框架的基准。 OmniCapBench 将预测目标从自由格式文本转移到跨三个轨道的原子、可验证评估单元集:实体引用、视觉镜头和音频事件,通过确定性约束检查和基于 LLM 的本地化语义比较实现可靠的评分。 OmniCapBench 拥有 786 个密集注释视频,有效区分 MLLM 感知错误,包括时间接地故障、身份漂移、跨模式错位和幻觉 描述。评估前沿 MLLM 揭示了较强的局部感知,但较弱的长视野视听推理,特别是在身份漂移和跨模态错位方面,为全模态开发提供了细粒度的路线图。