论文

更硬的文本嵌入基准 (HTEB):超越一维静态鲁棒性

The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness

模型评测基准与评测资源

摘要

MTEB 等嵌入基准报告每个模型的单个分数,隐式地将稳健性视为静态标量属性。我们认为嵌入的鲁棒性是多维的,因为模型对不同类型的变化有不同的反应,并且需要动态评估来暴露静态基准隐藏的故障。我们引入了 Harder Text Embedding Benchmark (HTEB),这是一个动态评估框架,通过使用 LLM 在评估时随机转换输入,沿着三个实际可解释的轴(词汇/文体、长度和语言)挑战模型的鲁棒性。通过对涵盖 42 种语言的 32 个数据集上的 16 个开放权重嵌入模型进行评估,并通过对英语子样本的 4,800 个个人评分进行验证,并辅以西班牙语源评估和对标签保存的探索性 STS-B 研究,我们发现了三种模式:(1)模型在轴上表现出特定的、部分解耦的稳健性配置文件。 (2) 在三个模型系列中,规模增加了绝对分数,但并没有缩小原始评估和转换后评估之间的差距。在这里,缩放往往会特别改善语言轴。 (3) 英语数据集比多语言数据集对 HTEB 变换更敏感。这表明 HTEB 沿着部署相关轴识别模型的优点和缺点,挑战当前的嵌入基准并主张多维、动态鲁棒性评估。我们公开运行 HTEB 的代码。