论文

部署相关的对齐无法仅从模型级评估推断

Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

模型评测智能体系统Agent HarnessAgent任务评测评测方法与指标长程任务评测

摘要

机器学习中的对齐评估很大程度上已成为模型的评估。有影响力的基准测试在固定输入(例如真实性、指令遵循或成对偏好)下对模型输出进行评分,这些分数通常用于支持有关部署对齐的主张。本文认为,部署相关的一致性不能仅从模型级评估中推断出来。相反,一致性声明应该索引到收集证据的级别:模型级别、响应级别、交互级别或部署级别。两项研究支持这一立场。首先,对 11 个对齐基准进行结构化审计,扩展到 16 个基准语料库,根据 Cohen kappa = 0.87 的 8 维评分标准进行双重编码,发现所检查的每个基准都缺乏面向用户的验证支持,而流程可操纵性几乎不存在。确定的少数交互基准,包括 tau-bench、CURATe、Rifts 和 Common Ground,在覆盖范围上仍然分散,并且基准构建而不是数据源决定了测量的内容。其次,使用跨三个前沿模型和四个支架的 180 个转录本进行的盲法跨模型压力测试发现,相同的验证支架将一个模型的验证支持提高到上限,而另一个模型则绝对不变。这表明支架功效取决于模型,并且审计发现的差距不能仅在模型层面弥补。我们提出了一个系统级评估议程:对齐配置文件而不是单一分数,用于可比交互评估的固定支架协议,以及使评估证据和部署声明之间的推理距离明确的报告模板。

部署相关的对齐无法仅从模型级评估推断:论文配图
图 2:跨八个交互对齐维度的基准审计热图。行:按层分组的 10 个审核基准加上 JudgeBench 作为元评估控制。列:锁定标题中的 8 个维度(附录 B)。细胞:0(苍白)、1(浅蓝色)、2(深蓝色)。在主审计的 88 个单元中使用 Cohen 的 κ=0.85\kappa=0.85 进行双重编码(在完整的 16 个基准语料库的 128 个单元中合并 κ=0.87\kappa=0.87;请参阅附录 C);所有 11 个基准测试中的 D3 列(验证支持)均为空。 D2 列几乎为空(τ\tau-bench 为 1)。四个交互基准在非重叠维度子集上得分为 2,表明碎片化而不是统一的覆盖范围。