论文
OPEN-1B:完全可审核的训练运行
OPEN-1B: A Fully Auditable Training Run
摘要
开源语言模型存在重现性问题。尽管发布了权重、训练数据和配方,但由于浮点运算的非关联性,它们都无法证明可重现。深度学习框架通常提供确定性执行模式,允许在同一台机器上进行可重复的操作。不幸的是,这种确定性并不适用于硬件,因此用户可以验证发布的检查点是否实际上是使用声明的训练配方生成的。这为未公开数据、注入偏差或后门留下了空间,而现有技术(例如学习证明或训练数据证明)无法排除这些后门。我们引入了一个新的模型透明度层,完全可审计,其中训练期间每个数据样本的每个操作都可以在异构商品硬件上独立重现,并具有按位确定性。通过对训练不确定性、GPU 内核缩减、跨数据并行集群的数据批量排序以及节点间/节点内集体通信的来源施加明确的顺序,我们可以在单个商品硬件上重放大型分布式训练运行的任何单个步骤,并根据已发布的轨迹进行检查。由于在一台机器上重放整个运行是不可行的,因此我们通过集体验证方案来支持这一点,其中许多独立审核员各自验证各个步骤,共同覆盖整个运行。我们发布了 Open-1B,这是一个在此制度下训练的模型,及其完整的预训练数据集、每个中间检查点、训练代码库以及重现和验证其训练的任何步骤所需的审计工具。