针对孟加拉国法律背景的高效大语言模型蒸馏:智能手机兼容的检索增强生成模型
Efficient LLM Distillation for Bangladesh Legal Context: A Smartphone-Compatible Retrieval-Augmented Generation Model
摘要
大多数公民无法获得孟加拉国的法律信息。法定文本只有英文,训练有素的律师集中在城市中心,依赖云的人工智能在移动连接不可靠的地方会失败,在这种情况下,幻觉的法律文本会造成直接伤害。该系统仅涉及法定解释;需要司法先例或判例推理的询问不属于其范围。我们通过两阶段渐进式知识蒸馏将 90 亿参数的 Gemma-2 教师压缩为 20 亿参数的学生,从而瞄准法定访问差距。第一阶段对 9,429 个质量门控的法律问答对进行监督微调(14,514 个生成的查询中有 65% 的接受率);第 2 阶段最大限度地减少了在温度 tau = 4.0 时针对教师前 50 个每个词元 logits 的稀疏 Kullback-Leibler 散度,通过 QLoRA(4 位 NF4、rank-32 LoRA 适配器)实现。先前的法律语言模型针对一般法律英语;该系统专门研究孟加拉国成文法。每个回复均基于混合检索,结合密集语义搜索 (60%) 和 BM25 (40%),涵盖孟加拉国宪法和国家立法的 36,029 条法定段落。在 50 个查询的英语基准测试中,蒸馏模型达到了 ROUGE-L 0.4715 和 BERTScore F1 0.5679,与检索增强的未蒸馏基线(ROUGE-L 0.2323、BERTScore 0.2340)相比,ROUGE-L 和 BERTScore 分别提高了 103% 和 143%。该适配器量化为 1.6 GB (GGUF Q4_K_M),在没有网络访问的 Pixel 6 上以每秒 4-8 个词元的速度运行。对 50 个孟加拉语查询的跨语言评估得出 ROUGE-L 0.4083 和 BERTScore 0.8133,表明针对纯英语语料库从孟加拉语输入进行有效检索。在单评估员试点中,一位执业律师以 4.16/5 的加权平均值对 50 个回复进行评分(90% 的评分为 4 或 5),支持文本重叠指标以外的实用性。