论文
DualFact+:面向程序性视频理解的多模态事实验证框架
DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding
摘要
我们提出DualFact,一个面向程序性视频字幕生成的双层多模态事实性评估框架。DualFact将事实正确性分为概念事实与情境事实:前者刻画抽象语义角色(如动作、食材、工具、地点),后者刻画这些角色在视频中的接地谓词-论元实现。为支持完整且角色一致的评估,DualFact引入隐式论元增强(VIA)与对比事实集。我们以两种模式实例化DualFact:DualFact-T对照文本证据验证事实,DualFact-V对照视频接地的视觉证据验证事实。在YouCook3-Fact和CraftBench-Fact上的实验表明,最先进的多模态语言模型生成的字幕流畅但常在事实上不完整,存在系统性遗漏与角色层面的不一致。与标准指标相比,DualFact与人类事实性判断的相关性更强,尤其是对情境事实;并且它揭示出,与视频接地验证相比,仅基于字幕的评估会高估幻觉。总体而言,DualFact提供了一个可解释且与人类对齐的评估协议,凸显了多模态事实接地中超越表面流畅性的持续挑战。
