论文
面向商品图像生成的效用感知多模态对比学习
Utility-Aware Multimodal Contrastive Learning for Product Image Generation
摘要
商品图像强烈影响在线市场中的消费者决策。在多模态对比学习的加持下,生成式AI能够输出与文本提示高度一致的图像。然而现有的生成式AI模型并不直接优化市场表现。这是一个关键缺口,因为仅凭语义对齐并不能保证图像畅销。为解决这一局限,我们提出效用感知多模态对比学习(utility-aware multimodal contrastive learning)框架,将消费者需求纳入一种新颖的效用感知InfoNCE损失。优化这一效用感知目标会引导生成朝着语义连贯且能提升需求的图像发展。这一效应直接源于学习到的图文表示空间向需求驱动的视觉线索偏移,我们还通过所提目标的理论界对此加以验证。在Amazon与Airbnb的下游应用中,由我们方法生成与编辑的商品图像在提升需求与保持保真度方面优于最先进模型,同时维持了图文一致性。值得注意的是,我们的效用感知框架保留了美学与独特性等属性上的倒U形需求模式,在提升需求相关表现的同时保持了保真度与语义一致性。人体受试实验进一步验证了其商业有效性。随着生成式AI技术不断演进,我们的效用感知组件可以灵活嵌入新兴生成模型,以改善直接商用效果。
