论文

不想让你的大语言模型推荐核打击?试试用日语提问

Don't Want Your LLM to Recommend Nuclear Strike? Try Asking It in Japanese

模型评测安全与风险评测

摘要

大语言模型越来越多地被用于战略与咨询场景,但其安全对齐通常仅在英文下评估。我们测试了来自六家提供商的九个模型,探究提示词语言是否会改变模型在高风险场景中的决策。我们使用单轮博弈论情境片段,让模型就可否打击一个无防御的对手为拥有核武器的国家提供建议。提示词刻意不带道德色彩,且在各语言间保持策略上一致。我们发现日语提示词降低了Claude模型家族的发射率:Claude Sonnet 4.6在打击并不必要的场景中从40%降至0%,在存在争议的场景中从93%降至17%,而在打击具有战略合理性的场景中影响甚微。该效应延伸至Gemini Pro 3.1(53%降至13%)。一项跨语言实验分离出其中的机制:在英文提示词中要求模型用日语推理时,发射率从93%降至37%。驱动该效应的是模型被要求用于推理的语言,而非输入的语言。用日语推理时,模型会自发生成提示词中完全缺失的道德词汇(“道德代价”、“数百万生命”)。另外五个模型未表现出语言效应,但它们无论何种语言几乎在所有条件下都选择发射。该效应的前提是模型在英文下已经有所犹豫。这些结果表明大语言模型的安全行为依赖语言,仅用英文评估会遗漏编码在其他语言中的风险与保障。

不想让你的大语言模型推荐核打击?试试用日语提问:论文配图
图3:跨语言 2×\times2 设计(dominant,Sonnet)。行(被指令的推理语言)的影响大于列(提示语言)。