论文

zkLLMPoT:高效零知识语言模型训练审计

zkLLMPoT: Efficient Zero Knowledge Proof of Training for Large Language Models

AI 基础设施AI安全与内容治理基础设施

摘要

模型权重与训练数据私有时,审计大语言模型训练所声称的结果很困难;在Transformer规模上,用密码学方法证明完整训练过程又过于昂贵。我们提出零知识框架zkLLMPoT,通过前向评估而非验证优化轨迹,证明训练后检查点满足审计方定义的性质。框架分两阶段:首先训练方固定架构并对模型权重作出密码学承诺,随后审计方选择挑战序列,防止训练方针对审计数据修改检查点;其次训练方证明已承诺模型在这些序列上达到的目标值。由此证明成本独立于训练迭代次数,不泄露模型权重,也无需访问私有训练数据。我们利用sumcheck与lookup论证验证Transformer计算,支持下一词元损失及任务特定审计目标。在四个模型系列的算子级基准上,所覆盖算子的证明耗时为:1.1—1.5B参数模型41—59秒,13B模型131秒;序列长度512时验证耗时低于半秒。