论文
VCIFBench:评估视频理解的复杂指令
VCIFBench: Evaluating Complex Instruction Following for Video Understanding
摘要
多模态 大语言模型 在视频理解方面取得了快速进展,但现有基准很大程度上依赖于简单的提示,并且提供的关于模型是否可以满足显式输出约束的证据有限。我们介绍 VCIFBench,这是一个评估视频理解中复杂指令遵循的基准。 VCIFBench 根据基准调整和直接基于视频的提示构建约束丰富的指令,涵盖内容、格式、风格和结构要求,并使用混合验证管道评估模型输出。该基准包含 306 个可满足的测试指令、540 个 DPO 训练实例以及一个 100 项诊断集,用于评估模型是否可以识别指令冲突。对 10 个 MLLM 的实验表明,满足联合约束仍然具有挑战性。偏好优化改进了两个模型系列的指令遵循,而 Conflict-100 表明模型通常执行看起来令人满意的子集,而不是检测全局不兼容性。