论文
中国劳动法大语言模型基准
Chinese Labor Law Large Language Model Benchmark
摘要
大语言模型(LLM)的最新进展推动了领域特定应用尤其是法律领域的显著进步。然而,GPT-4 等通用模型在需要精确法律知识、复杂推理与情境敏感性的专业子领域往往表现吃力。为解决这些局限,我们提出 LabourLawLLM,一个面向中国劳动法的法律大语言模型。我们还引入 LabourLawBench,一个覆盖多样化劳动法任务的综合性基准,包括法条引用、知识型问答、案件分类、赔偿计算、命名实体识别与法律案例分析。我们的评估框架将客观指标(如 ROUGE-L、accuracy、F1 与 soft-F1)与基于 GPT-4 打分的主观评估相结合。实验表明,LabourLawLLM 在各任务类别上持续优于通用模型与现有法律专用 LLM。除劳动法外,我们的方法为在其他法律子领域构建专用 LLM 提供了可扩展的途径,可提升法律 AI 应用的准确性、可靠性与社会价值。