论文

FCMBench-Video:文档视频智能基准测试

FCMBench-Video: Benchmarking Document Video Intelligence

模型评测基准与评测资源

摘要

文档理解是金融信用审查、入职和远程验证中的一项关键能力,其中决策准确性和证据可追溯性都很重要。与静态文档图像相比,文档视频呈现时间冗余且顺序展开的证据流,需要跨帧的证据集成,并保留与真实性敏感和反欺诈审查相关的采集过程线索。我们推出 FCMBench-Video,这是文档视频智能的基准,可评估真实捕获条件下的文档感知、时间基础和证据推理。对于符合隐私且真实的大规模数据,我们将构建组织为原子采集和合成工作流程,记录可重复使用的单文档剪辑,应用受控降级,并组装具有规定时间跨度的长格式多文档视频。 FCMBench-Video 由 495 个原子视频组成,组成 1,200 个长视频,并配有 11,322 个专家注释的问答实例,涵盖 28 种文档类型,持续时间超过 20 秒-60 秒,以及 5,960 个中文/5,362 个英文实例。对最近九个视频 MLLM 的评估表明,FCMBench-Video 提供了跨系统和功能的有意义的分离:计数是对持续时间最敏感的任务,跨文档验证和基于证据的选择探测更高级别的证据集成,而视觉提示注入提供了补充的稳健性维度。总体得分分布较宽且近似钟形,表明基准既不饱和也不被琐碎案例主导。总之,这些结果将 FCMBench-Video 定位为可重复的基准,用于跟踪视频 MLLM 在文档视频理解方面的进展以及在真实性敏感的信用域应用程序中探测能力边界。