论文
SinGlyphBench:语言模型调节中中文字形级混淆的诊断基准
SinoGlyphBench: A Diagnostic Benchmark for Chinese Glyph-Level Obfuscation in Language-Model Moderation
摘要
字形级别的混淆可能会使有害的中文内容对人类可读,同时降低自动审核的性能。我们推出了SinoGlyphBench,这是一种诊断基准,可识别标签关键语义锚并在文本和图像模式中创建匹配的原始输入和字形混淆输入。通过扰动锚点、背景上下文或两者,该设计将与审核相关的证据的损坏与一般的表面变化区分开来。在对 12 个 LLM 和 MLLM 进行的 176,916 次配对评估中,混淆使有害的假阴性和假阳性率分别增加了 6.1 个和 4.7 个百分点,并使四向准确度降低了 5.0 个百分点。模型保留了 75.7% 的匹配原始输入的正确决策。全范围扰动导致最大的降级,仅锚点扰动比仅背景扰动更具破坏性,并且跨脚本替换在文本模式中特别困难。对结构化输出的分析可识别可见形式读取、预期消息恢复和最终安全判断中可观察到的不匹配。因此,评估的模型对于使用非规范字形编写的中文内容仍然很脆弱。资源可在 https://github.com/fengshun124/SinoGlyphBench 获取。