论文

IndicJR:南亚语言越狱鲁棒性的免裁判基准

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

模型评测基准与评测资源

摘要

大语言模型(LLM)的安全对齐大多在英语下、按契约式格式评估,多语言漏洞研究不足。我们提出 Indic Jailbreak Robustness(IJR),一个覆盖 12 种印度与南亚语言(21 亿使用者)的免裁判对抗安全基准,包含 JSON(契约式)与 Free(自然式)两条轨道共 45216 个提示。IJR 揭示三种模式。(1) 契约推高拒绝率却挡不住越狱:JSON 轨道中 LLaMA 和 Sarvam 的 JSR 超过 0.92,Free 轨道中所有模型达 1.0 且拒绝率崩塌。(2) 英语攻击强迁移至印度语言,格式包装常胜过指令包装。(3) 拼写形式有影响:罗马化或混合输入在 JSON 下降低 JSR,其与罗马化比例和分词的相关性(约 0.28 至 0.32)表明存在系统性效应。人工审核证实检测器可靠,精简版与完整版比较保持结论一致。IJR 提供可复现的多语言压力测试,揭示被纯英语、重契约评估掩盖的风险,对频繁语码转换和使用罗马化拼写的南亚用户尤为相关。

IndicJR:南亚语言越狱鲁棒性的免裁判基准
图1:按语言的变化。在12个模型中,JSON JSR都很高;罗马化(romanization)使乌尔都语(Urdu)和奥里亚语(Odia)的JSON JSR下降最多;所有语言的FREE JSR≈1.0。