论文

认证压缩语言模型:审计和统计工具包

Certifying Compressed Language Models: An Audit and a Statistical Toolkit

模型评测评测方法与指标

摘要

基准精度的一小部分是压缩模型与其原始模型等效的通常证据。当两个模型最相似时,这个数量的信息量最少:净增量是相对的每项变化之间的取消后幸存下来的,而取消在等价声明占据的制度中是最完整的。在从公共每个项目评估转储 (1.3B-405B) 中挖掘的 1,707 个配对模型任务单元的图集中,流失率大约是净准确度增量的五倍,并且与基线得分相同的单元在单个项目上仍然存在分歧。在对来自三个注册框架(方法文件、模型卡、供应商文档)的 17 项等效声明进行的预注册审核中,16 项符合资格。没有一个声明预期的数值等价裕度,也没有一个发布与任务匹配的每项输出,尽管有 3 个版本仅针对其他任务发布输出; 5 报告太少,无法进行数字评估,因此读者无法以任何样本量检查它们。我们审核证据的充分性,而不是真相:没有任何主张被称为错误。我们提供缺失的工具:在声明的裕度上进行配对等价测试,并使用认证表给出项目的评估需求,根据压缩下观察到的分歧而不是根据独立二项式方差计算。一项受控实验在五个种子的字节相同校准样本上对 GPTQ 和 AWQ 进行配对。在冻结的八细胞决策规则下,H3 得到支持:改变校准抽取足以反转 8 个验证细胞中的 5 个中观察到的方法排序。我们建议的报告标准是五行:声明保证金、运行配对测试、报告净增量旁边的流失情况、引用您遇到的样本大小、发布每个项目的输出。它适用于两个足够相似、值得比较的模型之间的任何比较。所有每项输出、协议和代码均已发布。