论文

量化和缓解 大语言模型 中的韩国 Jamo 级印刷漏洞

Quantifying and Mitigating Korean Jamo-Level Typographical Vulnerabilities in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

韩语引入了普通字符级编辑模型无法捕获的额外印刷扰动级别:因为音节块内部由称为 jamo 的子字符单元组成,所以音节内可能会出现键盘级错误,要么产生有效但语义改变的字符,要么在表面上暴露原始 jamo。这两种结果都会破坏子词标记化,并且无法通过现有的语法错误纠正管道可靠地纠正,从而使 LLM 直接暴露于损坏的输入。为了量化此漏洞,我们将五种 jamo 级扰动类型应用于 KMMLU 基准,并评估四种语言模型,发现准确性随着扰动强度单调下降,并且参数缩放不会赋予针对音节内噪声的鲁棒性。我们进一步表明,拼写错误的输入会导致内部表示发生明显的变化,这种变化不能简化为普通答案的错误,并且在这些表示上训练的简单线性探针可以检测到具有高 AUROC 的看不见的扰动类型。受此信号的启发,我们提出了 Typo-Aware Chain-of-Thought (TACoT),只有当探测器检测到可能的拼写错误时,它才会将输入路由到思想链推理,从而以推理成本的一小部分恢复大部分 CoT 准确性增益。