AISafetyBenchExplorer:指标感知的AI安全基准目录揭示碎片化测量与薄弱的基准治理
AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance
摘要
大语言模型(LLM)安全评测的快速扩张催生了庞大的基准生态,却未能形成相应连贯的测量生态。我们提出AISafetyBenchExplorer,一个收录2018至2026年间发布的195个AI安全基准的结构化目录,通过多工作表模式组织,记录基准级元数据、指标级定义、基准论文元数据与仓库活跃度。这一设计使元分析不仅能覆盖存在哪些基准,还能覆盖文献中安全性如何被操作化、聚合与判定。利用这一更新后的目录,我们识别出一个核心结构性问题:基准的激增已超过测量标准化的步伐。当前格局以中等复杂度基准为主(94/195),而只有7个基准位列热门层级。该工作簿进一步报告了仅英文评测(165/195)、仅评测资源(170/195)、GitHub仓库疏于维护(137/195)、Hugging Face数据集疏于维护(96/195)的高度集中,以及在具有已知发表渠道元数据的基准中对arXiv预印本的严重依赖。在指标层面,目录显示accuracy、F1 score、safety score与基准总分等常见标签往往掩盖了实质不同的判定方式、聚合规则与威胁模型。我们认为,该领域的主要失效模式是碎片化而非稀缺。研究者如今拥有众多基准产物,但往往缺乏共享的测量语言、有原则的基准选择依据,以及发表后维护的持久治理规范。AISafetyBenchExplorer通过提供可溯源的基准目录、受控的元数据模式与复杂度分类体系来弥合这一缺口,共同支持更严格的基准发现、比较与元评估。
