论文

无审查的开源模型:重分发作为持久层

Uncensored Open-weight Models: Redistribution as the Persistence Layer

模型评测安全与风险评测

摘要

快速扩张的参与者生态系统正在从开放式人工智能模型中删除内置的安全护栏。我们通过确定关键生产商、下游复制品和新兴应用来描述这个生态系统。 2024年1月至2026年3月期间,我们在HuggingFace上识别出3,471个原始未经审查的模型,每个模型平均被重新包装2.4次;三个参与者占所有 8,164 个压缩重新分配的 52%。一旦跨单独的帐户、格式和注册表(例如 Ollama)进行量化和镜像,这些模型就会持续存在,无论上游是否删除,并且更容易在下游部署。在已识别的 1,643 个集成未经审查的大型语言模型 (ULLM) 的 GitHub 应用程序中,25% 被归类为明显恶意。

无审查的开源模型:重分发作为持久层:论文配图
图 1:排名前 10 的改良基础模型系列。实心条显示原件;条纹条显示压缩的重新分布。乘数表示每个原始文件的压缩重新分配。颜色表示产地:蓝色=西方实验室(Meta、Google、Mistral等),金色=中国实验室(阿里巴巴、DeepSeek、Zhipu等)。模型合并(生态系统的 4.4%)被排除在外;合并最常见的是 Llama 和 Mistral 基础模型。