论文
大语言模型懂哥伦比亚法吗?哥伦比亚法律体系可靠性基准
Do Large Language Models Know Colombian Law? A Reliability Benchmark for the Colombian Legal System
摘要
大语言模型日益用于支持法律实践、教育与研究,但其在美外国家法律体系中的可靠性基本无记录。我们提出经专家验证的基准,评估LLM在哥伦比亚法律体系上的可靠性:含横跨十个法律领域、三种题型(封闭选择、半开放与开放式IRAC)的1042个条目,经人在回路管道与多阶段专家评审构建。我们用与格式匹配的指标评估15个当代专有与开放权重模型:封闭问题准确率范围很宽(从Gemini 3.1 Pro的0.905到0.577),但自由文本法律回答的事实正确性没有任何模型超过0.45(0-1量表)。我们发现答案相关性与正确性分离(Spearman rho=-0.46):模型听起来可靠地响应却经常出错——对非专家用户是特别值得担忧的模式。封闭题准确率与自由文本正确性强秩相关(rho=0.94),因此廉价选择题筛选能预测模型排名但夸大绝对可靠性。独立的量规LLM裁判与盲法人专家评分都复现自由文本排名(rho≥0.88);裁判进一步揭示模型引用的规范只有约一半正确,其余错误或不存在。可靠性随法律领域系统变化并随问题复杂度呈倒U形。结果表明当前LLM在哥伦比亚法律任务上需要专家监督,把答案接地到权威来源是提高可靠性的有前途路径。我们发布基准构建管道以支持可复现评估。