论文

ALEE:通过以英语为中心的最小对对嵌入进行任何语言评估

ALEE: Any-Language Evaluation of Embeddings via English-Centric Minimal Pairs

模型评测基准与评测资源

摘要

文本嵌入是语义相似性任务的标准,但它们的评估仍然是一个开放的挑战。当前的基准是静态的,仅涵盖有限的语言集,通常是特定于领域的,容易过度拟合,并且不能很好地代表低资源语言。为了解决这些限制,我们引入了 ALEE,这是一个将 Sentence Smith (Li et al., 2025) 扩展到跨语言和段落级别的框架。 ALEE 使用抽象含义表示 (AMR) 生成具有受控、细粒度语义转换的英语最小对,并与目标语言的翻译配对。这种方法可以使用英语并行数据对任何语言的模型进行有针对性的诊断。我们对跨越三个并行数据集的多种嵌入模型和 275 多种语言进行了大规模实证研究。在 ALEE 上,不同语言、文本长度和语言现象的性能差异很大,暴露了跟踪训练资源和子词标记化中语言流行程度的跨语言语义表示中持续存在的差距。我们在 https://github.com/Andrian0s/any-lang-embed-eval 发布了 ALEE