论文

PUMA:通用多模态嵌入的事后稀疏化以实现高效检索

PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval

模型优化稀疏化

摘要

通用多模态嵌入器可以跨文本、图像和组合查询进行检索,但它们的密集表示会产生较高的内存和推理成本。事后稀疏化可以降低这些成本,但多模态检索的探索仍未充分。我们引入了 PUMA,一种稀疏自动编码器配方,可将通用多模态嵌入映射到紧凑的稀疏代码,而无需重新训练主干网络:预训练阶段保留密集的点积几何结构,之后对稀疏编码器进行微调以进行检索。我们评估了涵盖文本到图像和组合图像检索的五个基准。在 Qwen3-VL-Embedding-2B 上,PUMA 在统计上与五个数据集中的四个数据集上的密集检索无法区分或有所改进。我们进一步确定了事后稀疏化的两种失败模式:TopK 前支持不足和检索未对齐的主动支持。 PUMA 将向量存储减少了 8-16 倍 (FP32),并且比较大候选池上的精确密集评分快达 25 倍,从而实现高效的多模式检索。