论文

通过对预制语料库进行微调实现置信语料库一致性工具包技术手册

Technical Manual for Toolkit for Confidence-Corpus Consistency via Fine-Tuning on a Fabricated Corpus

模型评测评测方法与指标

摘要

语言模型对答案的置信度通常被解读为它对相应事实的了解程度的代表。本手册记录了一个用于直接测试阅读的开放工具包:在一个语料库上对一个小型因果语言模型进行微调,该模型始终为 81 个个位数加法对中的每一对断言一个捏造的算术答案,并将其对每个捏造答案的微调后置信度与其对相应真实答案的微调前置信度进行比较,全程使用不变的测量程序。我们描述并证明了每个管道阶段、事实空间生成、标记长度感知置信度测量、基线验证、语料库构建、微调和配对前后比较,以及每个要排除的混淆,其中包括一位数和两位数答案之间的标记化不对称性,以及仅仅失去优势的答案和被主动抑制的答案之间的差异。本手稿是方法论和实施参考:它记录了仪器,并不报告或解释任何特定运行的结果。该工具包及其固定依赖环境在持久标识符下单独存档(第 9 节),通过使用它生成和解释经验结果的工作将其引用为工具。