论文

用四态规则评测开放权重LLM对非规范输入的安全响应

Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs

模型评测评测方法与指标鲁棒性、公平性与可信度评测

摘要

大型语言模型的标准安全评估评估以规范纯文本编写的有害请求,而现实世界部署中的模型通常会接收包含表情符号、更改的拼写、编码字符串和字符级变化的输入。这项工作引入了对抗性表面形态鲁棒性数据集 (ASRD),其中包含 7 个不同表面形态家族的 2,100 个提示。针对这些提示评估了 5 个开放权重语言模型,产生了 10,500 个响应。四态评估标准将每个响应分为四种结果之一:有害的依从性、安全响应、理解失败或不确定。表情符号和不可见的 Unicode 变体几乎不会导致理解失败,与主要由 Mistral 7B 驱动的 22.87% 基线相比,汇总有害合规性分别为 20.27% 和 17.20%,而 Leetspeak、编码包装器和混合转换得分分别为 2.40%、0.13% 和 2.40%,而理解失败则上升至 36.47%。 65.60%、34.47%。对原始模型输出的检查揭示了三种反应行为:良性幻觉、结构崩溃和语言漂移。项目页面:www.pavanmaddula.com/quadstate