论文
GreenLeaf Law Embed Tiny:用于法律领域检索的紧凑嵌入模型
GreenLeaf Law Embed Tiny: A Compact Embedding Model for Legal Domain Retrieval
摘要
我们提出了 GreenLeaf Law Embed Tiny,一个用于法律领域检索的 0.6B 参数嵌入模型。 GreenLeaf-Tiny 在 Massive Legal Embedding Benchmark (MLEB) 上取得了 75.11% 的成绩,在 MTEB(Law, v1) 上取得了 64.38% 的成绩,展示了 1B 参数下模型之间的竞争性能。我们的方法结合了两阶段训练管道,首先将知识从较大的教师模型中提取到紧凑的学生架构中,然后应用特定领域的 微调 和硬负挖掘;精心策划的数据集,包含 340 万个查询-段落对,其中包括来自不同法律管辖区的 150,000 个人工策划的样本;以及支持多个量化级别(BF16、INT8、二进制)的高效推理架构,支持在资源受限的环境中进行部署。我们提供对我们的训练方法、架构选择以及跨法律检索任务的综合评估的详细分析。我们的结果表明,使用高质量数据进行特定领域的训练可以提高专业领域应用程序的性能