论文

用于可控时尚检索的属性条件多模态时隙分解

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

摘要

时尚检索通常需要同时满足多个属性,例如类别、颜色、图案和人口统计。整体嵌入将这些信号混合到单个向量中,使得检索时特定于属性的控制变得困难。许多现有的语义 ID 方法提供离散的项目代码,但这些代码通常被优化为项目级或剩余地址,并且不公开命名的、独立可控的属性槽。我们引入了 MM-slotgate,一种多模态槽编码器,它将 Fashion-CLIP 文本和图像嵌入分解为四个命名属性槽。每个插槽都会学习自己的文本图像门,因此颜色和图案等基于视觉的属性可以更多地依赖图像证据,而类别和人口统计等面向分类的属性可以更多地由文本驱动。在 H&M 上,使用组合的槽相似性和槽 logits 检索分数,MM-slotgate 实现了 0.7566 宏 ConstraintSatisfied@10,优于等权重多模态融合 (0.7142) 和 fCLIP 仅文本检索 (0.4755)。最大的增益是颜色,从 0.321 提高到 0.889(+0.568 绝对值),因为学习的颜色门将 57.4% 的权重分配给图像证据。学习的门无需模态监督即可解释:颜色倾向于图像,类别倾向于文本,模式和人口统计位于中间附近。由此产生的槽也仍然是可控的:线性探针没有显示出超出标签相关基线的测量过量泄漏,并且量化槽代码支持有针对性的干预,包括 15.3 倍的颜色提升。这些结果表明,可控时尚检索受益于类型化、属性条件多模式槽,而不是单个全局嵌入或不透明的项目级语义 ID。