论文

审核语言模型水印中的跨语言公平性

Auditing Cross-Lingual Fairness in Language Model Watermarking

模型评测评测方法与指标

摘要

大语言模型 输出的水印方案几乎完全使用每个方案的检测阈值和一组狭窄的质量测量对英文文本进行评估。多语言部署暴露了评估设计选择,这些选择对英语来说无关紧要,但可以跨语言确定结论。我们提出了一个由四个组成部分组成的评估框架:根据部署上下文进行经验校准的检测阈值、区分校准失败和检测失败的与阈值无关的伴随测量、三个不相交的质量测量范式(分布、配对语义和参考困惑)以及类型族分区上跨语言差异的广义熵分解。该框架应用于六种水印方案、三种开放权重生成器、涵盖四种文字和八种类型家族的十一种语言,以及基础和指令调整机制,揭示了单语言单范式评估无法显现的故障模式。在检测和质量方面,观察到的差异主要是在类型划分上的家族之间,这表明水印中的跨语言公平性差距是语言属性的结构性差异,而不是特定语言所特有的差异。