论文

小模特会使用你给他们的法则吗?用于孟加拉国法律 QA 的上下文注入 微调

Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh

模型评测模型能力评测

摘要

小语言模型可以接受管辖的法律规定,但仍然会错误地回答。我们在包含相关法律的示例上测试 微调 是否可以改善检索到的法律的后续使用。我们从六场孟加拉国演出和三个时间表中整理了 2{,}165 个双语 QA 记录,然后将 Qwen3.5 微调为 0.8B、2B 和 4B。评估使用 2022 年和 2023 年孟加拉语和机器翻译英语的孟加拉国律师协会考试,无检索、BM25 或 FAISS,在三轮种子运行中严格一致性评分。在 0.8B 时,微调 将 2022 年英语 FAISS 分数从 2 分提高到 34 分(满分 100 分)。0.8B 和 2B 的增益经受住了配对测试,但 4B 模型没有可检测到的净增益:孟加拉语有所改善,而一些英语状况却有所退化。 微调 还减少了从孟加拉语转向大部分英语的答案,从 44.0--53.2\% 减少到 0.2--0.7\%,并在每个级别调整了 $p<.001$。因此,检索质量并不是唯一的瓶颈。小型双语法律模型在如何使用所提供的法律以及是否以所要求的语言回答方面也有所不同。该数据集可在 https://huggingface.co/datasets/momahadi/bangladesh-legal-qa-dataset 上公开获取。