论文

Magis-Bench:评估 LLM 的治安法官级法律任务

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

模型评测基准与评测资源

摘要

法律人工智能的现有基准主要关注 LLM 必须提供法律论据或文件的任务,但“判断”这些论据的能力——权衡相互竞争的主张、将理论应用于事实以及做出合理的决定——可以说对于一个运作良好的法律体系来说,与辩护本身一样重要。我们介绍 Magis-Bench,这是一个评估 LLM 治安法官级别写作任务的基准,该任务源自巴西最近的司法职位竞争性考试。 Magis-Bench 包含 2023 年至 2025 年间进行的 8 次考试的 74 道题,包括多轮结构的话语法律分析题和需要组成完整民事和刑事司法句子的实践练习。我们使用 LLM 作为法官的方法和四个独立的前沿模型作为评估者来评估 23 个最先进的 LLM。我们的结果显示出评委之间的强烈一致性(Kendall 的 $W = 0.984$;成对 Kendall 的 $τ\ge 0.897$),其中 Google 的 Gemini-3-Pro-Preview 获得了最高平均分 (6.97/10),其次是 Gemini-3-Flash-Preview (6.67) 和 Claude-4.5-Opus (6.46)。即使是表现最好的模型,得分也低于最高值的 70%,这表明司法层面的法律推理和写作对于当前的 LLM 来说仍然具有挑战性。我们发布完整的基准、模型输出和评估代码,以支持法律人工智能能力的进一步研究。