论文

超越固定基准与最坏情况攻击:语言模型的动态边界评估

Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models

模型评测评测方法与指标

摘要

如今评估大语言模型 (LLM) 依赖于固定基准,这些基准将相同的一组项目应用于任何模型,从而产生掩盖能力差距的上限和下限效应。我们认为信息最丰富的评估信号位于边界处,在随机采样解码下,每次提示通过的概率接近 0.5 美元,并提出动态边界评估(DBE),它主动定位每个模型的边界并将其置于全局可比较的难度等级上。 DBE 提供三个工件:(i) 一个经过校准的项目库,涵盖安全性、能力和真实性,每个项目的难度标签都经过 9 美元参考LLM的验证; (ii) 技能引导边界搜索 (SGBS),一种仅使用 API 级查询访问查找给定目标 LLM 边界项的搜索算法; (iii) 评估协议,将新的LLM置于统一的能力量表上,并在目标超出银行覆盖范围时自适应地增加评估集。我们将 DBE 实例化为四个类别,涵盖安全性(有害请求拒绝和过度拒绝)、能力(受限指令遵循)和真实性(多轮阿谀抵制)。由此产生的评估涵盖了更广泛的模型范围,且没有饱和,同时保持与现有数据集的兼容性。