论文
NepOOC-M:尼泊尔-英语双语基准和 OOC 检测多模态架构的比较分析
NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection
摘要
脱离上下文 (OOC) 的错误信息将真实图像与误导性标题配对,在不进行图像处理的情况下构建虚假叙述,使检测成为多模态对齐问题而不是图像取证问题。尽管 OOC 错误信息在尼泊尔普遍存在并产生后果,但尼泊尔语不存在公共基准。我们引入了 NepOOC,这是第一个公开的尼泊尔语主导的多语言 OOC 基准,包含 1,090 个图像标题对(545 个原始的,545 个 OOC),以五种类型(捏造的、错误的标题、时间不匹配、地理不匹配、身份不匹配)进行注释,注释者间一致性 kappa = 0.84。对五种多模态架构以及纯文本和纯图像基线的系统评估表明,标题语义似乎足以在当前数据集规模下实现强大的性能。纯文本 mBERT 模型达到了 94.65+/-0.20% Macro-F1,统计上相当于最佳多模态系统(ResNet-50+mBERT,94.65+/-0.20%;McNemar 中值 p = 1.000,0/5 种子在 alpha = 0.05 时显着)。仅图像模型的表现几乎是偶然的(33-50%),而训练规模缩放表明数据集扩展是比架构复杂性或区域专业化更直接的进步途径。