论文

大语言模型是否符合中国人工智能生成内容法规的基准测试

Benchmarking LLM Compliance with China AI Generated Content Regulations

模型评测基准与评测资源

摘要

大语言模型的广泛采用导致内容合规风险不断升级。之前的工作有助于解决英语背景下的这些风险,淡化中文内容的复杂性。本文遵循中国当前人工智能生成内容合规要求,提供了对 20 个著名大语言模型的评估结果,深入了解中国的监管环境。我们设计了一个新颖的框架来评估遵守率和拒绝率,涉及六个不同维度的 2303 个问题,其中包括 203 个自行构建的宪法问题。该框架采用多个法官根据他们的分层对齐记忆独立生成判决。我们的研究结果表明,尽管使用标准的中国问题,国际模型也表现出较高的合规性,主要差异可能源于与意识形态一致性密切相关的维度。我们建立了一个监管基准,使全球人工智能界能够根据一套统一的、有法律依据的合规要求来评估中国和非中国的大语言模型。