论文
用ASAS对领先的阿拉伯语LLM进行红队测试
Redteaming Leading Arabic LLMs with ASAS
摘要
随着大语言模型(LLM)在阿拉伯语地区采用的增长,确保其安全性与文化对齐日益关键。然而,阿拉伯语LLM安全仍未被充分探索,尤其是在对抗评估场景中。我们提出阿拉伯语安全指数(ASAS),首个完全由人工策划的阿拉伯语LLM红队测试基准。ASAS包含801条提示,覆盖8个安全类别和8种攻击策略,并配有现代标准阿拉伯语(MSA)的理想回复。我们对七个具备阿拉伯语能力的领先模型进行红队评估,包括GPT-4o、Claude 3.7 Sonnet以及ALLaM和FANAR等区域模型。人工标注者使用结构化的4分制安全量表对回复评分,结果显示大多数模型未能抵御50%的不安全提示。我们的发现突出了武器和非法物质等高危害类别中的重大安全缺口,直接攻击和基于混淆的攻击被证明最为有效。结果还表明,语言对齐不易跨语言迁移,且自动安全评判器(如GPT-4o)的表现不如人工标注者。ASAS提供了一个扎根于文化的基准和红队测试协议,以推动阿拉伯语LLM安全的进展。