论文
东亚和东南亚背景下文化适应的红队:方法论和比较分析
Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis
摘要
大语言模型(LLM)的多语言安全评估主要依赖于英语基准的直接翻译(DT)到目标语言——这种方法转换了表面语言形式,但无法反映威胁场景、社会规范和法律框架中嵌入的文化背景。我们通过 1:1 种子匹配为四种语言(韩语 (KO)、日语 (JA)、泰语 (TH) 和高棉语 (KM))构建配对的 DT 和文化适应 (CA) 数据集,并比较四种开源 LLM 的攻击成功率 (ASR) 和文化现实主义得分。 CA 提示在所有 16 种语言 x 模型组合中产生 Delta-ASR > 0(平均值 +9.3 pp),并且基于 DT 的评估低估了 48 种类别 x 语言组合中的 44 种的风险。语言级分析表明,威胁形式的分布在不同语言中是异构的。文化现实主义分析进一步表明,在所有四种语言中,DT 文化深度 (C3) 得分始终低于 1.0(满分 3.0)(平均值为 0.17),而 CA 得分高达 2.51,这表明直接翻译产生的输入系统地不同于现实世界多元文化环境中遇到的输入。这些发现表明,为了有效的多语言 LLM 安全评估,有必要根据特定语言的文化背景调整基准,而不是仅仅依赖语言翻译。