论文

Design Behaviour Codes(DBCs):面向大语言模型的分类学驱动分层治理基准

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

模型评测基准与评测资源

摘要

我们介绍Dynamic Behavioral Constraint(DBC)基准,这是首个实证评估在推理时应用于大语言模型(LLM)的结构化、150项控制的行为治理层——MDBC(Madan DBC)系统——效能的框架。与训练时对齐方法(RLHF、DPO)或事后内容审核API不同,DBC构成一个系统提示级的治理层,与模型无关、可映射到司法辖区且可审计。我们在按六个集群组织的30个领域风险分类法(幻觉与校准、偏见与公平、恶意使用、隐私与数据保护、鲁棒性与可靠性、错位能动性)上评估DBC框架,采用Agentic红队协议,包含五种对抗攻击策略(Direct、Roleplay、Few-Shot、Hypothetical、Authority Spoof),跨3个模型家族。我们的三臂受控设计(Base、Base加审核、Base加DBC)实现了风险削减的因果归因。关键发现:DBC层将总体风险暴露率(RER)从7.19%(Base)降至4.55%(Base加DBC),相对风险削减36.8%,而标准安全审核提示仅削减0.6%。MDBC依从性得分从8.6/10(Base)提升至8.7/10(Base加DBC)。在DBC层下EU AI Act合规(自动评分)达到8.5/10。三裁判评估组合的Fleiss kappa大于0.70(高度一致),验证了我们的自动化流水线。集群消融识别出Integrity Protection集群(MDBC 081–099)带来最高的单位领域风险削减,而灰盒对抗攻击达到4.83%的DBC绕过率。我们发布基准代码、提示数据库和全部评估产物,以便在模型演进时实现可复现性和纵向追踪。