论文

超越准确性和表面流畅性:对法律条款生成的大语言模型进行风险敏感评估

Beyond Accuracy and Surface Fluency: Risk-Sensitive Evaluation of LLMs for Legal Clause Generation

模型评测评测方法与指标

摘要

大型语言模型(LLM)越来越多地用于起草合同语言,但传统的准确性或基于偏好的评估与法律起草的匹配度很差。条款可能是流畅且风格优美的,但仍然省略了必要的排除、以不可执行的方式分配风险、假设不适用的管辖权或使一方承担监管责任。本文提出了评估大语言模型生成的合同条款的实证研究设计和框架。该研究评估了四种模型 - Claude Haiku 4.5、Gemini 2.5 Flash Lite、GPT 5.4 Nano 和 Qwen 3.5 Flash,涵盖 22 个合同条款类别和 34 种法律驱动的故障模式。我们结合了两个评估框架:CLAUSE(按法律功能和失败目标对提示进行分类)和 LENS-CRAFT(对九个法律质量维度的输出进行评分)。该研究没有对维度得分进行平均,而是应用了最大严重性原则,以便单个具有法律决定性的缺陷仍然可见。本文提供了评估方案、分类法、分析计划以及用于报告实证结果的结果结构。我们认为,法律人工智能评估应该超越总体准确性,转向针对特定条款、故障模式驱动和风险敏感的评估。