论文
VCG:极端冷启动条件下电子商务视频源的多模态检索框架
VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions
摘要
数字商务格局正在从静态、搜索驱动的目录转向动态、沉浸式视频源。这种转变引入了“极端冷启动”问题:与传统项目不同,新的短视频缺乏协作过滤所需的密集交互历史记录。此外,沉浸式反馈会引入强烈的位置和持续时间偏差,从而扭曲标准参与信号。在本文中,我们演示了视频候选生成(VCG)系统,这是一个可扩展的多模式检索引擎,旨在解决大规模电子商务环境中的这些挑战。通过利用适应领域的视觉语言模型(基于 CLIP),我们将用户和视频映射到共享语义空间,从而实现基于视觉内容而不是行为历史的零镜头检索。我们详细介绍了系统的架构,并提出了比较生成式(LLM)与判别式(CLIP)嵌入的严格评估。我们的结果表明,虽然生成模型擅长属性预测,但它们在检索任务中遭受嵌入空间崩溃的困扰。在线 A/B 测试表明,VCG 有效地减轻了参与偏差,使深度视频完成度提高了 50%。为了展示系统的功能,我们提供了一个交互式演示,其中包含三个双向检索场景:产品到视频、视频到产品和零样本语义搜索。