论文

小模型可以推理法律文件吗?比较研究

Can Small Models Reason About Legal Documents? A Comparative Study

模型评测模型能力评测

摘要

大语言模型 显示了合法应用的前景,但部署前沿模型引发了对成本、延迟和数据隐私的担忧。我们通过使用五种提示策略(直接、思维链、few-shot、BM25 RAG 和密集 RAG)在三个法律基准(ContractNLI、CaseHOLD 和 ECtHR)上测试 9 个模型来评估 sub-10B 参数模型是否可以作为实用的替代方案。在每种配置使用三个随机种子的 405 次实验中,我们发现仅激活 3B 参数的专家混合模型在平均准确度上与 GPT-4o-mini 相匹配,同时在合法持有识别方面超过了它,并且架构和训练质量比原始参数数量更重要。我们最大的模型(9B 参数)总体表现最差。事实证明,思想链提示与任务密切相关,改善了合同的必然性,但降低了多项选择的法律推理能力,而少样本提示则成为最一致有效的策略。比较 BM25 和 RAG 的密集检索,我们发现了几乎相同的结果,这表明瓶颈在于语言模型对检索上下文的利用而不是检索质量。所有实验均通过云推理 API 进行,总成本为 62 美元,这表明无需专用 GPU 基础设施即可进行严格的 LLM 评估。