论文
Netflix 通过多模式嵌入实现多媒体资产个性化
Multimedia Asset Personalization via Multimodal Embeddings at Netflix
摘要
个性化宣传资产,即艺术作品图像和视频预览剪辑,对于 Netflix 上的内容发现至关重要。传统的资产选择模型依赖于基于 ID 的交互历史记录,这使得它们对资产内容视而不见,并且无法为新推出的游戏和资产提供服务。我们描述了多模态嵌入如何重塑 Netflix 的生产系统,并为将基础模型嵌入引入推荐系统的从业者报告可转移的经验教训。首先,预训练的图像嵌入解锁了跨标题、跨画布的知识转移。通过 CLIP 图像嵌入增强两塔模型,可以让单个模型服务于所有五种 Netflix 艺术品画布类型,取代五个单独训练的每个画布模型,并显着提高冷启动性能。轻量级扩展重用 CLIP 的联合文本图像空间,使艺术品在搜索中具有个性化查询感知能力。其次,多模态在视频预览个性化方面绝对胜过任何单一模态。我们描述了 MediaFM,我们的内部三模态基础模型,在 Netflix 节目目录中的大规模镜头语料库上进行训练,融合了视觉 (SeqCLIP)、音频 (wav2vec 2.0) 和定时文本信号;它被用于视频预览个性化,在离线和在线 A/B 测试中都优于强大的纯视觉基线。第三,一个简单的离线代理任务,其性能与在线结果相关,可以加速实验和产品化周期。仅根据嵌入来预测基于流行度的获胜者,对嵌入模型和版本进行排名,在任何端到端集成或 A/B 测试之前修剪选择空间;它现在控制每个新的 MediaFM 检查点。我们还分享使这些部署可行的生产工程决策(共享嵌入基础设施、低延迟服务、廉价筛选),以及我们遇到的设计权衡和故障模式。