论文

使用文本条件转换控制嵌入空间

Controlling Embedding Spaces with Text-Conditioned Transformations

上下文与知识检索增强

摘要

CLIP 等模型中的多模态嵌入空间可实现语义相似性检索和跨模态零样本分类等强大功能。这些嵌入将高级语义压缩到单个向量中,其代价是主要表达主要对象等主导语义,同时抑制其他重要属性(例如相机角度或色调)。我们提出了视觉嵌入的文本条件转换,使这些属性可以明确访问。给定属性类别的自然语言描述(例如“颜色”或“艺术风格”),网络会生成强调指定属性的仿射变换。对文本进行调节使其能够同时学习许多属性,并在推理时通过直观的界面访问它们。该网络经过训练,可以将变换后的嵌入与冻结的潜在空间对齐,从而能够使用现有的大规模嵌入进行检索,而无需任何重新编码。当应用于完整的集合时,相同的机制会转换属性解缠任务(例如多聚类)的潜在空间。通过直接在潜在空间中操作,我们的方法提供了一个统一且高效的框架来控制嵌入空间,在基于属性的检索和多属性组织任务中展示了最先进的性能,推理成本接近于零。项目页面:https://joefioresi718.github.io/ControlEmbed_webpage/