论文
生成嵌入基准:密集嵌入中可以保存多少信息?
Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?
摘要
嵌入已成为连接基础模型与下游系统的标准表示接口。大多数嵌入基准通过以嵌入空间的可分离性为中心的判别性任务或几何标准来评估表示。然而,此类评估的出色表现并不能确定压缩到嵌入中的内容是否仍然可供下游生成器访问。为了解决这一差距,我们引入了生成嵌入基准(GEB),其中解码器仅使用冻结嵌入和问题文本来回答问题,而无需访问原始图像或中间视觉特征。此读数下的答案质量衡量生成信息:可从嵌入中恢复的与答案相关的内容。 GEB 包括一个精心策划的视觉问答数据集,其中包含 1,800 个项目的开发拆分和一个包含 900 个项目的测试拆分,涵盖自然图像、场景文本和视觉文档。使用通用解码器和训练配方,我们评估了仅视觉和视觉语言联合模式下的七个公共嵌入模型。在测试集上,仅视觉得分范围为 28.25 到 33.21;通过图像-问题联合编码,所有五个基于 VLM 的嵌入模型得分都较高,最好的达到 65.56。匹配嵌入的性能也优于纯文本输入、零嵌入和打乱嵌入。自然图像信息比场景文本或视觉文档信息更容易恢复,而访问原始图像的 Qwen3-VL-2B 参考达到 84.30。总之,这些结果表明,生成读出暴露了基于可分离性的评估无法捕获的信息瓶颈。