论文

DualFact+:面向程序性视频理解的多模态事实验证框架

DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

模型评测评测方法与指标

摘要

我们提出DualFact,一个面向程序性视频字幕生成的双层多模态事实性评估框架。DualFact将事实正确性分为概念事实与情境事实:前者刻画抽象语义角色(如动作、食材、工具、地点),后者刻画这些角色在视频中的接地谓词-论元实现。为支持完整且角色一致的评估,DualFact引入隐式论元增强(VIA)与对比事实集。我们以两种模式实例化DualFact:DualFact-T对照文本证据验证事实,DualFact-V对照视频接地的视觉证据验证事实。在YouCook3-Fact和CraftBench-Fact上的实验表明,最先进的多模态语言模型生成的字幕流畅但常在事实上不完整,存在系统性遗漏与角色层面的不一致。与标准指标相比,DualFact与人类事实性判断的相关性更强,尤其是对情境事实;并且它揭示出,与视频接地验证相比,仅基于字幕的评估会高估幻觉。总体而言,DualFact提供了一个可解释且与人类对齐的评估协议,凸显了多模态事实接地中超越表面流畅性的持续挑战。

DualFact+:面向程序性视频理解的多模态事实验证框架:论文配图
图 1:MultiFactScore 管道概述。字幕模型生成描述,使用多模态和文本 NLI 模型从中提取和验证正面事实。错误分解可识别幻觉、显着性和遗漏错误,以进行细粒度的事实分析。