论文

用于个性化多模态生成的离散偏好学习

Discrete Preference Learning for Personalized Multimodal Generation

模型训练偏好优化

摘要

生成模型的出现使得能够根据用户的喜好创建文本和图像。现有的个性化生成模型有两个关键局限性:缺乏精确偏好建模的专用范式,以及尽管现实世界中多模态驱动的用户交互仍生成单模态内容。因此,我们提出个性化多模态生成,它通过多模态交互中的专用偏好模型捕获特定于模态的偏好,然后将它们输入下游生成器以获取个性化多模态内容。然而,这项任务提出了两个挑战:(1)专用建模的连续偏好与生成器架构固有的离散词元输入之间的差距; (2) 生成的图像和文本之间可能存在不一致。为了解决这些问题,我们提出了一个称为个性化多模态生成的离散偏好学习(DPPMG)的两阶段框架。在第一阶段,为了准确学习离散的特定于模态的偏好,我们引入了特定于模态的图神经网络(专用偏好模型)来学习用户的特定于模态的偏好,然后将这些偏好量化为离散的偏好标记。在第二阶段,离散的特定于模态的偏好标记被注入到下游文本和图像生成器中。为了进一步增强跨模式一致性,同时保留个性化,我们设计了跨模式一致和个性化的奖励来微调词元相关参数。对两个现实世界数据集的广泛实验证明了我们的模型在生成个性化且一致的多模式内容方面的有效性。