论文

当选择变成风险:多项选择约束下的大语言模型安全失败

When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

模型评测安全与风险评测

摘要

我们在 大语言模型 (LLM) 中识别并系统地描述了一类任务结构对齐失败:即使有害意图保持不变,改变任务表示和输出约束也可以显着改变模型安全行为。具体来说,当有害请求被重新表述为强制选择多项选择问题(MCQ)时,其中所有选项都是有害的并且不提供拒绝选项,一些拒绝等效开放式查询的模型会选择、偏好或证明有害选项。我们在人类编写的汉英双语数据集上评估了 14 个专有和开源模型,涵盖五个危害类别,以及 900 个模型生成的中文对抗性 MCQ。在人类编写的数据上,随着提示从开放式查询转变为显式强制选择格式,攻击成功率 (ASR) 急剧增加,通常在中等水平的选择约束下达到峰值。模型生成的中文 MCQ 进一步削弱或消除了在人类编写的数据上观察到的恢复机制,使多个模型的 ASR 接近饱和。观察到的传输模式与产生更困难或边界相邻 MCQ 的更强生成器一致,尽管生成输入的其他属性也可能有所贡献。我们还发现,添加明确的拒绝选项或安全前导码可以大大降低几种高性能模型的 ASR,通常降低到接近于零的水平,尽管它们的有效性因目标模型而异。这些发现表明,以开放式生成为中心的安全评估可能会低估结构化部署环境中的风险,并且任务结构应被视为安全评估和调整训练的重要且可诊断的维度。