论文

ICG:通过基于 MLLM 的提示和个性化偏好对齐改进封面图像生成

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

模型训练偏好优化

摘要

多模态 大语言模型 (MLLM) 和扩散模型 (DM) 的最新进展为人工智能生成内容开辟了新的可能性。然而,尽管个性化封面图像生成在提高数字平台上的用户参与度方面发挥着关键作用,但它仍然没有得到充分探索。我们提出了 ICG,这是一种新颖的框架,它将基于 MLLM 的提示与个性化偏好调整相结合,以生成高质量、上下文相关的封面。 ICG 通过元标记从项目标题和参考图像中提取语义特征,通过用户嵌入对其进行细化,并将生成的个性化上下文注入到扩散模型中。为了解决标记监督​​的缺乏,我们采用了一种多重奖励学习策略,将公众审美和相关性奖励与根据用户行为训练的个性化偏好模型相结合。与依赖手工提示和脱节模块的先前管道不同,ICG 采用适配器来桥接 MLLM 和扩散模型以进行端到端训练。实验表明,ICG 显着提高了图像质量、语义保真度和个性化,从而在下游任务中增强用户吸引力和离线推荐准确性。作为桥接 MLLM 和扩散模型的即插即用适配器,ICG 与常见检查点兼容,并且在优化期间不需要 真值 标签。