论文

TANDEM:面向多模态仇恨言论的时间感知神经检测

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

模型训练强化学习

摘要

社交媒体平台日益被长篇多模态内容主导,其中有害叙事通过音频、视觉与文本线索的复杂交织构建。虽然自动化系统能以较高准确率标记仇恨言论,但它们常作为“黑箱”运作,无法提供有效的人在回路审核所需的细粒度、可解释证据,例如精确的时间戳与目标身份。本工作中,我们提出 TANDEM,一个将视听仇恨检测从二分类任务转化为结构化推理问题的统一框架。我们的方法采用新颖的串联强化学习策略,视觉-语言与音频-语言模型通过自约束的跨模态上下文相互优化,在无需密集帧级监督的情况下稳定长时序上的推理。在三个基准数据集上的实验表明,TANDEM 显著优于零样本与上下文增强基线,在 HateMM 上目标识别取得 0.73 F1(较最先进水平提升 30%),同时保持精确的时间定位。我们进一步观察到,尽管二分类检测稳健,但由于标签固有的模糊性与数据集不平衡,多类别设定下区分冒犯性与仇恨性内容仍然困难。更广泛地说,我们的发现表明结构化、可解释的对齐即使在复杂多模态设定中也可实现,为下一代透明且可操作的线上安全审核工具提供了蓝图。

TANDEM:面向多模态仇恨言论的时间感知神经检测
图2:TANDEM 架构。该系统采用串联式(tandem)强化学习策略,视觉模型与音频模型在以彼此上下文为条件的情况下迭代更新。Long Video Processor 负责分段,Multi-Task Reward Function 基于摘要长度、输出格式、分类准确率、片段定位与目标识别计算综合分数,以指导策略梯度更新。