论文

Nemotron 希腊语教学:挖掘语料库、调整检索并为跨专业领域的现代希腊语奠定基础

Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains

模型训练监督微调与指令调优

摘要

尽管现代希腊语对于法律、能源、金融和医疗应用中的检索增强生成 (RAG) 很重要,但 NVIDIA Nemotron 检索模型和主要多语言检索基准中均没有现代希腊语。我们提出了 Nemotron 检索堆栈对现代希腊语的端到端改编,包括语料库挖掘、综合监督、检索 模型训练、重排序器改编、阅读器 微调 以及名为 HERA 的新基准。我们的研究表明,无参数 BM25 基线优于专业希腊语语料库上的几种现成的多语言密集检索模型。在对 65,773 个希腊语检索对进行 微调 后,Nemotron 1B 嵌入器将 nDCG@10 从 0.362 提高到 0.835,并且大大优于其未适应的对应物。所学语言能力转移到通用领域希腊语,尽管相对 BM25 的优势仍然取决于领域。我们进一步调整了跨编码器重新排序器,并展示了跨专业领域的一致改进。最后,我们对 Nemotron 30B-A3B 专家混合阅读器进行 LoRA 调整,以实现基于检索证据的生成,将判断答案正确性从 29.4% 提高到 66.9%,同时显着提高 忠实性 和引文质量。我们还推出了 HERA,这是第一个用于检索增强生成的大规模希腊语基准,并发布了我们的改编模型和基准以支持希腊语 RAG 系统的未来研究。