论文

Swiss-Bench SBP-002:瑞士法律和监管任务的前沿模型比较

Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks

模型评测基准与评测资源

摘要

虽然最近的工作在瑞士法律翻译(Niklaus 等人,2025)和大学考试的学术法律推理(Fan 等人,2025)上对 大语言模型 进行了基准测试,但现有的基准还没有评估前沿模型在瑞士监管合规应用任务中的表现。我介绍了 Swiss-Bench SBP-002,这是一个由 395 个专家制作的项目组成的三语基准,涵盖三个瑞士监管领域(FINMA、Legal-CH、EFK)、七种任务类型和三种语言(德语、法语、意大利语),并使用结构化三维评分框架评估 2026 年 3 月以来的十个前沿模型,该框架通过盲三评委 LLM 小组(GPT-4o、Claude Sonnet)进行评估4,Qwen3-235B),采用多数投票聚合,加权 kappa = 0.605,参考答案由独立人类法律专家对 100 项子集进行验证(73% 评级正确,0% 评级错误,完美的法律准确性)。结果显示了三个描述性性能集群:A 级(正确率 35-38%)、B 级(26-29%)和 C 级(13-21%)。事实证明,该基准测试非常困难:即使是排名最高的模型(Qwen 3.5 Plus),正确率也只有 38.2%,其中错误率为 47.3%,部分正确率为 14.4%。任务类型难度差异很大:法律翻译和案例分析的正确率在 69-72% 之间,而监管问答、幻觉检测和差距分析的正确率仍低于 9%。在这个名单(七个开放权重,三个闭源)中,一个开放权重模型排名领先,并且几个开放权重模型匹配或优于其闭源模型。这些发现为评估零检索条件下瑞士监管任务的前沿模型能力提供了初步的经验参考点。