模型
EmbeddingGemma 2 开放统一文本、图像与音频嵌入
EmbeddingGemma 2
概述
EmbeddingGemma 2 是基于 Gemma4 的开放多模态嵌入模型,约740M参数,由270M文本、170M视觉及300M音频模块组成。它将多种输入放到共同768维向量空间,支持 Matryoshka 截断到512、256、128维;768到128维是六倍缩减。上下文为8192词元,官方给出的输入示例包括约5.5分钟音频、29张图或58帧视频,具体组合须按处理器限制。权重已通过 Hugging Face 和 Kaggle 提供,许可Apache2.0;Model Garden为后续计划。共享文本分词器和音频编码器可减少与Gemma4组合部署的重复资源,但官方Pixel11 Pro量化内存数值不是整个应用的总内存。适合本地语义检索和跨模态匹配,仍需验证领域检索质量。