论文

当非正式文本破坏 NLI 时:标记化失败、分布转移和有针对性的缓解措施

When Informal Text Breaks NLI: Tokenization Failure, Distribution Shift, and Targeted Mitigations

模型评测鲁棒性、公平性与可信度评测

摘要

我们研究了在应用于 SNLI 和 MultiNLI 的四种变换中,非正式表面形式如何降低 ELECTRA-small (14M) 和 RoBERTa-large (355M) 中的 NLI 准确性:俚语替换、表情符号替换、Gen-Z 填充标记及其组合。俚语替换(用非正式的等价物替换正式单词,例如“going to”->“gonna”、“friend”->“homie”)导致的降级最小(最多 1.1pp):俚语词汇大部分落在 WordPiece 的覆盖范围内,因此分词器可以在不丢失信号的情况下处理它。 Emoji 将内容词替换为 ELECTRA 的 WordPiece 标记器映射到 [UNK] 的 Unicode 字符,在任何学习参数看到输入信号之前就将其破坏(93.6% 的表情符号示例至少包含一个 [UNK],平均每个示例 2.91 个)。噪声标记(无上限,死胡同,说实话)完全在词汇中,但在 NLI 训练数据中不存在,这与为它们分配不携带的推理权重的模型一致。这两种故障模式响应不同的干预措施:预处理通过在标记化之前对文本进行规范化来恢复表情符号的准确性;增强通过在训练期间将模型暴露于带有噪声的示例来处理噪声。两者的混合体在 SNLI 上的 ELECTRA 组合变体上达到了 88.93%(高于 75.88%),而在干净文本方面没有出现统计上的显着下降。与 GPT-4o-mini 零样本相比,未缓解的 ELECTRA 在转化变体上的表现明显较差 (p < 0.0001);混合 ELECTRA 在所有 SNLI 变体中都超越了它,并在 MultiNLI 上达到了统计平价。