论文
从内容到受众:广播电视分析的多模态注释框架
From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics
摘要
广播电视内容的自动语义注释提出了独特的挑战,结合了结构化视听合成、特定领域的编辑模式和严格的操作限制。虽然多模态 大语言模型 (MLLM) 已表现出强大的通用视频理解能力,但它们在广播特定设置中跨管道架构和输入配置的比较有效性在经验上仍然不足。本文对意大利广播电视新闻中应用的多模态注释管道进行了系统评估。我们构建了跨四个语义维度标记的特定领域剪辑基准:视觉环境分类、主题分类、敏感内容检测和命名实体识别。在结合了视觉信号、自动语音识别、说话人二值化和元数据的逐步丰富的输入策略下,在九个前沿模型(包括 Gemini 3.0 Pro、LLaMA 4 Maverick、Qwen-VL 变体和 Gemma 3)中评估了两种不同的管道架构。实验结果表明,视频输入的增益强烈依赖于模型:较大的模型有效地利用了时间连续性,而较小的模型在扩展的多模态上下文下表现出性能下降,这可能是由于词元过载。除了基准测试之外,选定的管道还部署在 14 个完整的广播剧集中,并与意大利媒体公司提供的标准化观众测量数据集成了分钟级注释。这种集成可以对主题级受众敏感度和代际参与差异进行相关分析,证明了所提出的基于内容的受众分析框架的操作可行性。