论文

TailorMind:迈向偏好对齐的多模态内容生成

TailorMind: Towards Preference-Aligned Multimodal Content Generation

应用与实践内容创作

摘要

个性化内容系统依赖可用的用户生成内容(UGC)——当合适内容缺失、延迟或创建成本高时便陷入困境。虽然多模态生成器可按需合成内容——如何把行为踪迹转化为可直接生成的偏好仍少被探索。我们研究个性化多模态内容生成:在没有既有物品池或不需等待匹配UGC的情况下创建用户定制的多模态内容。我们提出TailorMind——把协同偏好建模与可控多模态生成链接。TailorMind经超图协同过滤增广稀疏用户历史——并以排序误差反馈与文本梯度下降优化文本画像。检索增强的风格控制把输出锚定到真实UGC模式——跨模态内聚反思减少语义漂移。我们构建TailorBench——取自三个主流平台、沿连贯性、新颖性、美学、幻觉与画像五维度评估的基准。实验表明TailorMind取得有竞争力或更强的连贯性——较代表性生成基线与真值UGC改善新颖性与美学质量——展示对检索可得内容或可比UGC的优势——同时在重排序中取得至多29%的Recall增益。代码发布于 https://github.com/iLearn-Lab/TailorMind。

TailorMind:迈向偏好对齐的多模态内容生成:论文配图
图 2:所提出的用于个性化多模态生成的 TailorMind 框架的总体架构。