论文
部署相关的对齐无法仅从模型级评估推断
Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone
摘要
机器学习中的对齐评估很大程度上已成为模型的评估。有影响力的基准测试在固定输入(例如真实性、指令遵循或成对偏好)下对模型输出进行评分,这些分数通常用于支持有关部署对齐的主张。本文认为,部署相关的一致性不能仅从模型级评估中推断出来。相反,一致性声明应该索引到收集证据的级别:模型级别、响应级别、交互级别或部署级别。两项研究支持这一立场。首先,对 11 个对齐基准进行结构化审计,扩展到 16 个基准语料库,根据 Cohen kappa = 0.87 的 8 维评分标准进行双重编码,发现所检查的每个基准都缺乏面向用户的验证支持,而流程可操纵性几乎不存在。确定的少数交互基准,包括 tau-bench、CURATe、Rifts 和 Common Ground,在覆盖范围上仍然分散,并且基准构建而不是数据源决定了测量的内容。其次,使用跨三个前沿模型和四个支架的 180 个转录本进行的盲法跨模型压力测试发现,相同的验证支架将一个模型的验证支持提高到上限,而另一个模型则绝对不变。这表明支架功效取决于模型,并且审计发现的差距不能仅在模型层面弥补。我们提出了一个系统级评估议程:对齐配置文件而不是单一分数,用于可比交互评估的固定支架协议,以及使评估证据和部署声明之间的推理距离明确的报告模板。
