论文

小模特会使用你给他们的法则吗?衡量孟加拉双语法律基准的语境使用

Do Small Models Use the Law You Give Them? Measuring Context Use on a Bilingual Bangladesh Legal Benchmark

模型评测模型能力评测

摘要

微调 可以提高法律问答的准确性,而无需改进模型如何使用上下文中提供的法律。我们研究了双语孟加拉国法律问答中的这种区别,其中观察到的错误可能是由于答案评分、检索或未能使用相关法律而引起的。我们构建了一个保留层次结构的法定语料库、2,165 个经过审查的双语 微调 示例以及一个包含 150 个项目的供应法控制。我们评估了六种指令调整模型:Llama-3.2-1B、Llama-3.2-3B、Qwen3.5-0.8B、Qwen3.5-2B、Qwen3.5-4B 和 Gemma-4-E2B,每个模型具有三个 LoRA 种子。为了分离效果,我们结合了受约束的选项字母评分、循环选项轮换和控制性条款的删除。在 398 个 Bar Council 输出中,精确行解析器将 Qwen3.5-2B seed-42 适配器的准确度增益提高了 50.0\%,而选项评分仅产生 $3.0\%$。对于 Gemma-4-E2B,两种评分方法有利于不同的系统。当保证存在管理规定时,六个参考模型中的五个在四阶标准下提高了 $14.7\%-19.3\%$。删除该规定会使模型的准确性降低 $8.0\%-15.3\%$ 点,而其适配器的准确性会降低 $13.8\%-14.9\%$ 点。然而,差异估计表明,微调 之后对管理规定的依赖没有增加。结果表明,合法的适应声明需要将记分器、检索器 和模型效果分开。我们的准则和数据可在 https://anonymous.4open.science/r/bangladesh-legal-qa-11E3 获取