论文

CCTVBench:多模式对比一致性交通视频 QA 基准 LLM

CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

模型评测基准与评测资源

摘要

安全关键的交通推理需要对比一致性:模型必须在事故发生时检测出真正的危险,并在几乎相同的反事实场景下可靠地拒绝看似合理但错误的假设。我们提出了 CCTVBench,这是一个对比一致性交通视频质量保证基准,基于配对的真实事故视频和世界模型生成的反事实对应物,以及差异最小、相互排斥的假设问题。 CCTVBench 对每个视频问题四元组强制执行单一结构化决策模式,并提供可操作的诊断,将故障分解为积极遗漏、积极交换、消极幻觉和互斥性违规,同时区分视频与问题的一致性。跨开源和专有视频 LLM 的实验揭示了标准每个实例 QA 指标与四级对比一致性之间存在巨大且持续的差距,其中不可靠的非上述拒绝是关键瓶颈。最后,我们引入了 C-TCD,这是一种对比解码方法,利用语义上唯一的对应视频作为推理时的对比输入,从而提高实例级 QA 和对比一致性。