论文
超越英语和规避:高风险的人工注释多域基准 LLM 中文安全评估
Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese
摘要
当 大语言模型 (LLM) 在中文环境中部署时,会出现一种令人不安的模式:在英语中运行良好的安全系统崩溃了。这些系统难以跨越语言和文化界限,使模型面临对抗性提示,这些提示利用了中文特有的规避技术,包括拼音罗马化、字符分解、网络俚语和对冲语气。为了弥补这一差距,我们引入了 ChiSafe-PAS(中文安全试点注释集),这是一个由 1,897 条对抗性中文提示组成的人工注释基准,涵盖四个高风险领域:自残和暴力、毒品和非法贸易、欺诈和讽刺。其中,1,544 个条目带有完整的黄金标准注释:3 类响应标签(REFUSE、SAFE-REDIRECT、RESPOND)、九类混淆分类法、风险级别评级和注释器基本原理。我们详细描述了数据集设计、注释过程和混淆分类法。我们的主要目标是实用的:为研究界提供高质量、有文化基础的资源,用于对 LLM 安全一致性进行基准测试。在此过程中,我们解决了该领域的三个更广泛的紧张局势:训练和评估数据之间的模糊界限、基于现实世界风险的领域覆盖的需求以及作为文化专业知识替代品的规模限制。