论文

CHILLGuard:通过可扩展数据构建和模型感知偏好对齐实现细粒度中文 LLM 安全护栏

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

模型训练偏好优化

摘要

大语言模型 (LLM) 生成的恶意内容可能会带来严重的安全风险和道德问题。虽然现有的LLM安全护栏在英语或多语言环境中表现出色,但它们缺乏对中国特定监管政策、文化背景和语言细微差别的适应,无法支持针对多样化部署需求的细粒度风险分类。在本文中,我们引入了针对中文场景的5个宏观、31个微观类别的细粒度风险分类,并构建了CHILLGuard:专用的中文LLM内容安全护栏。为了解决高质量带注释的中文安全数据的严重稀缺问题,我们提出了一种可扩展的多阶段数据构建流程:通过检索增强生成扩展多源语料库,通过快速工程重写生成隐式有害样本,并通过基于多模型投票的标签校准来细化高质量数据。在此基础上,我们构建了 CHILLGuardTrain(一个包含 405,007 个样本的大规模训练集)和 CHILLGuardTest(一个经过严格策划的带注释的测试集,包含 51,745 个样本)。然后,我们通过模型感知直接偏好优化,在生成器分类器协作框架下在 CHILLGuardTrain 上训练 CHILLGuard。多种设置下的大量实验证明了 CHILLGuard 的最先进性能,例如,在我们的基准测试中,F1 分数比 Qwen3Guard-8B-Strict 相对提高了 15.92%。我们在 https://github.com/cswbyu/CHILLGuard 上发布了我们的资源。