论文

乌克兰法律文本基础模型的词元膨胀率和零样本性能:比较研究

Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study

模型评测模型能力评测

摘要

乌克兰法律文本上的基础模型的分词器词元膨胀率变化为 1.6 倍,但模型选择实践中缺乏这一成本关键维度。我们根据乌克兰国家登记处 (EDRSR) 的 273 项经过验证的法院判决对来自 5 个提供商的 7 个模型进行了基准测试,衡量了标记器的词元膨胀率和三项任务的零样本性能。出现了四项发现。 (1) 在相同的输入下,Qwen 3 模型比 Llama 系列模型多消耗 60% 的词元,这使得分词器分析成为经济高效部署的先决条件。 (2) NVIDIA Nemotron Super 3 (120B) 获得了最高的综合得分 (83.1),在 API 成本模型规模的三分之一处优于 Mistral Large 3(总参数多出 5.6 倍),这对于域性能来说是一个较差的代理。 (3) 少量提示会使绩效降低高达 26 个百分点;分层和提示敏感性消融证实这是乌克兰语演示所固有的,而不是示例选择的产物。 (4) 跨时间泛化实验表明,在战前法院判决(2008-2013)上训练的分类器在应用于全面入侵时代决策(2022-2026)时损失了 27.9 个百分点,并且存在明显的前后不对称性:较新的模型向后迁移(比前向迁移高出 14.6 个百分点),但较旧的模型在战时法律语言上会灾难性地失败。对于从业者来说:分词器分析应该先于模型选择,对于形态丰富的语言,零样本是比少样本更可靠的默认值。为了支持可重复性并解决法律 NLP 基准中乌克兰语缺失的问题,我们发布了 2008 年至 2026 年期间 14,452 项法院判决的公共数据集,并标注了三个时间周期的七个结果标签,捕捉了武装冲突对司法程序的影响。