论文
通过定向 检索器 微调 乌兹别克法律 RAG 的云和本地部署
Cloud and On-Premises Deployment of Uzbek Legal RAG via Targeted Retriever Fine-Tuning
摘要
部署 大语言模型 进行法律问答会带来通用排行榜无法捕获的挑战,特别是对于资源匮乏的语言和严格的操作限制。我们报告了为乌兹别克斯坦建立和运营检索增强(RAG)法律助理的情况,该助理必须在两种制度下运行:一种托管云服务,在每个词元成本上限内最大限度地提高答案质量;另一种是为法律数据可能不会离开其基础设施的客户进行本地部署,这限制了我们在延迟限制下在有限的本地硬件上使用开放权重模型。由于此设置不存在评估,因此我们构建了两个领域基准:一个包含 178 个专家注释的法律查询(具有标准法律条款范围)的检索基准,以及一个由 LLM 评判模型评分的 504 个专家策划的问答对的端到端基准,我们根据人类判断和不同模型家族的独立评判模型来验证其评级。在每种制度下应用这些基准,我们发现开放与专有的差距很小,并且可以通过 微调 廉价地缩小。因此,我们训练 UTE-1,它是乌兹别克语开放模型中最先进的文本嵌入器。我们还证明,由于长上下文法律问答对硬件的密集需求,通过 微调 缩小性能差距既不切实际,又没有必要,因为法律法规经常变化。我们通过报告 QLoRA 实验的负面结果来支持这一点。我们从为生产中的真实用户提供服务的系统中提取了类似部署的实用指南。我们发布了基准、评估代码和微调嵌入器 (UTE-1) \href{https://metric-ai-lab.github.io/Uzbek-Legal-RAG/}{在此 https URL},以支持未来低资源法律 NLP 的工作。