论文
连接短视频和直播:用于跨域表示学习的推理引导多模态 LLM
Bridging Short Videos and Live Streams: Reasoning-Guided Multimodal LLMs for Cross-Domain Representation Learning
摘要
随着直播服务的发展,许多平台都提供短视频和直播来满足多样化的需求。短视频承载着巨大的流量和丰富的行为信号,而直播作为核心转化场景,行为数据稀疏,冷启动十分严峻。将用户兴趣从短视频转移到直播推荐可以缓解这些问题。同时,短视频和直播是复杂的多模态项目,集成多模态信号可以提高推荐性能。尽管多模态 大语言模型 (MLLM) 显示出强大的多模态理解和推理能力,但它们在跨领域推荐中的应用仍未得到充分探索。为此,我们提出了推理引导的跨域表示学习(RGCD-Rep),这是一种推理引导的框架,用于从短视频到直播的跨域推荐。 RGCD-Rep 引入了资源高效的 MLLM 推理,并通过两阶段训练学习由行为协作指导的可转移项目表示。首先,推理感知 蒸馏 让冻结的教师 MLLM 生成结构化的跨领域推理知识,并将其提炼为轻量级的学生 MLLM。其次,可转移性引导的跨域表示学习将项目表示分解为可转移表示和域残差表示。生成的表示会离线计算并集成到下游检索任务中,从而实现低成本的工业部署。大量的离线实验证明了RGCD-Rep的优越性。部署在快手直播推荐系统后,A/B测试显示多个核心业务指标都有显着提升,证实了其在实际行业场景中的有效性和实用性。 RGCD-Rep 已全面部署,每天为超过 4 亿用户提供服务。