论文
Popcorn:多模式电影推荐中视觉证据的可配置基准
Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation
摘要
电影是长篇视听作品,但推荐基准通常依赖于预告片、缩略图或元数据。这些来源在语义和可扩展性方面有所不同:完整的电影保留了消费级别的证据,预告片集中了促销亮点,缩略图提供了稀疏但目录规模的视觉信号。我们提出了 Popcorn,这是多模式电影推荐中视觉证据的可配置基准,它将标题对齐的完整电影/预告片嵌入与由现代视觉和视觉语言模型编码的 MovieLens 链接的缩略图功能相结合。 Popcorn 通过单个配置合约标准化模态组装、融合、分割、评估和 LLM 增强元数据。实验表明,缩略图 VLM 提供了强大的、可扩展的项目侧证据,而受控预告片/整部电影的比较表明,视觉证据源不可互换:源和融合策略的选择会影响排名准确性、覆盖范围、多样性和校准。该框架可从 https://github.com/RecSys-lab/Popcorn 获取。