论文
KZ-SafetyPrompts:大语言模型 的哈萨克安全评估提示数据集
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
摘要
哈萨克斯坦在评估 大语言模型 安全行为的资源中代表性不足。我们推出了 KZ-SafetyPrompts,这是一个哈萨克斯坦提示数据集,用于十一个类别的安全评估,涵盖常见风险领域,如自残、暴力、儿童剥削、性内容、种族主义内容、激进化以及受管制商品或非法活动。该数据集包含 5,717 个用哈萨克语(西里尔文)本地编写的提示,按类别组织,并带有用于跨语言分析的英文翻译。提示类似于现实的用户查询,通常采用青少年或儿童的风格,并且被表述为意图提示,没有程序说明。我们记录编写协议、标记程序(包括边界案例决策规则)和质量控制步骤(模式标准化、完整性检查和重复数据删除)。我们还将这些类别与广泛使用的安全分类法保持一致,以支持与现有评估流程的集成。 GPT-4o 的基线结果显示,总体拒绝率为 28.2%,不同类别的拒绝率从 5.5% 到 53.8% 不等,这表明哈萨克语提示暴露了纯英语评估未捕获的特定类别安全差距。