论文
ORPHEAS:用于检索增强生成的跨语言希腊语-英语嵌入模型
ORPHEAS: A Cross-Lingual Greek-English Embedding Model for Retrieval-Augmented Generation
摘要
跨希腊-英语双语应用程序的有效检索增强生成需要能够捕获特定领域语义关系和跨语言语义对齐的嵌入模型。现有的多语言嵌入模型将其表示能力分布在多种语言中,限制了它们对希腊语的优化,并且无法对希腊语文本固有的形态复杂性和特定领域的术语结构进行编码。在这项工作中,我们提出了 ORPHEAS,一种专门用于双语检索增强生成的希腊语-英语嵌入模型。 ORPHEAS 使用基于知识图的 微调 方法生成的高质量数据集进行训练,该方法应用于多样化的多领域语料库,从而实现与语言无关的语义表示。单语言和跨语言检索基准的数值实验表明,ORPHEAS 的性能优于最先进的多语言嵌入模型,这表明在形态复杂的语言上的领域专用 微调 不会损害跨语言检索能力。