论文
OmniCap-IF:全视频描述的基准测试和改进指令跟踪能力
OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning
摘要
虽然全模态 大语言模型 (OLLM) 在联合处理音频和视频流方面表现出了令人印象深刻的能力,但它们严格遵守复杂、多方面用户指令的能力在很大程度上仍未得到探索。现有的基准主要关注整体视频理解或纯文本指令遵循,未能捕捉模式和用户限制之间复杂的相互作用。为了弥补这一差距,我们推出了 OmniCap-IF,这是第一个专门用于评估全模式字幕中的指令跟踪功能的综合基准测试。 OmniCap-IF 包含一个系统框架,可从两个维度评估字幕:格式正确性和内容正确性。我们的基准测试涵盖纯视觉、纯音频和视听模式的 50 种不同约束类型,同时集成时序定位来评估时空精度。对 1,920 个高质量样本的著名模型的广泛评估揭示了显着的性能差异。此外,我们的分析揭示了一个关键的“格式内容权衡”,表明格式复杂性的增加会直接降低模型的全模态推理能力。最后,为了推进该领域的发展,我们策划了一个 54K 指令调整数据集 OmniCap-IF-54K 并推出了 OmniCaptioner-IF,它在复杂指令遵守和一般全模式字幕性能方面取得了显着改进。