论文
扩展基于 MLLM 的推荐的阐明的基本原理
Scaling Articulated Rationales for MLLM-based Recommendation
摘要
我们提出了 SARA,这是一个工业框架,可将稀疏的清晰用户理由转化为可扩展的推荐信号。其数据引擎将调查问卷回复整理到 SARA-HQ,为通过 SFT 和质量改进 DPO 调整 SARA-7B 提供明确的偏好监督。这种对齐将基本原理生成从 $86{,}564$ 调查问卷涵盖的作者扩展到完整的 $10$M 作者空间。 SARA-Ranker 将生成的正面和负面理由转化为用户-作者交互建模和负面反馈历史建模的特征,将明确的理由与产品排名联系起来。对未见过的作者的评估表明,SARA-7B 比评估的通用 MLLM 产生更具体、相关和扎根的基本原理。除了具有多模式功能的强大行业排名基线之外,单独的在线 A/B 测试表明,积极理由整合使观看时间增加了 $0.99\%$,而消极理由整合则使仇恨反馈减少了 $8.16\%$。每日刷新和超过 30 美元天的生产部署进一步证明了该方法的操作可行性。这些发现确立了明确的理由作为对行为和内容信号的有用补充,并证明了 MLLM 在将稀疏的人类解释扩展到可改善行业推荐的偏好信息方面的实际作用。