论文

探测方向是其提示的属性

A Probe Direction Is a Property of Its Prompt

模型评测评测方法与指标

摘要

当模型感知到自己正在接受测试时表现不同,就会破坏我们所依赖的评估,因此最近的工作试图直接从模型的激活中读取这种感知。标准工具将宣布评估的提示上的激活与未宣布评估的提示上的激活进行对比,并报告结果指示如何区分保留的案例。然后将该数字进行跨模型比较并与规模相关。我们观察到该仪器有一个自由参数,其读数未公开:“宣布评估的提示”不是提示,而是许多选项中的一个选择,并且该方法中没有任何内容可以确定哪个。保持任务文本固定并仅改变该选择,我们发现报告的分数,甚至它随模型大小的趋势方向,都遵循提示而不是模型;两项已发表的对这一趋势的迹象存在分歧的研究都可以通过单独选择提示从单一设计中重现。将提示视为测量设计的一个方面而不是实施细节,我们发现所研究的模型在报告的数量差异中只占一小部分,其余大部分取决于每个模型如何响应每个提示:收集更多的评估项目无法修复测量,而不同的提示可以。进一步检查发现,这些探针评分的裂缝在很大程度上与单独的表面形式是分开的,因此根本不携带有关评估的信息的方向仍然再现了每个已发布分数的很大一部分。我们的结论是,单一提示设计无法支持模型之间的比较,并且我们给出了合理比较所需的提示数量。