论文

下一篇:通过视觉语言模型进行推理驱动的视频推荐

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

模型训练强化学习

摘要

我们提出了 NEXT(Next-interest EXploration Transformer),这是一种推理驱动的视频推荐框架,可以对用户刚刚观看的视频进行推理,推断观看者的下一个意图,并检索具体的后续视频。诸如剧集之类的显式延续是直接链接的;隐式情况是通过生成意图查询并搜索匹配候选者来处理的。这种“项目到意图到项目”的公式可以产生超越共同参与相关性或语义相似性的定向推荐。为了使该框架大规模可靠,我们训练了 NEXT-8B,这是一种专门训练的 8B 视觉语言模型,具有三阶段配方:用于与查询无关的证据提取的感知增强强化学习、针对真实和合成视觉 QA 混合的分布对齐监督 微调 以及用于最后一英里对齐的组相对策略优化。 NEXT-8B 实现了最佳的单模型 DocVQA 性能,总体排名第二,仅次于多智能体系统,同时超越了更大的 200B+ 规模模型,并且在特定于任务的 LLM 作为法官评估中,与基本模型相比,下一个意图逻辑质量提高了 3.3%。我们将 NEXT 部署为大型社交媒体推荐系统中的额外检索路径,并观察到统计上显着的生产收益,包括 +0.53% 的观看时间和 +0.51% 的不同视频曝光率。总的来说,NEXT 表明,经过精心训练的紧凑视觉语言模型可以作为生产规模下一个兴趣探索的实用推理引擎。