论文

MiniGPT:从第一原理重建 GPT

MiniGPT: Rebuilding GPT from First Principles

模型训练预训练

摘要

本文介绍了 MiniGPT,这是 PyTorch 中 GPT 风格自回归语言建模的紧凑的从头开始实现。目的是在研究 Andrej Karpathy 的 nanoGPT 设计后,从第一原理重建核心 GPT 管道,同时将模型和训练代码独立编写在单个笔记本中。 MiniGPT 实现了 token 和位置嵌入、因果多头自注意力、pre-LayerNorm Transformer 块、残差连接、前馈 MLP 层、下一个 token 交叉熵训练(教师强制)、验证跟踪、检查点选择和自回归文本生成。本文评估了使用字符级标记化在 Tiny Shakespeare 数据集上的实现。经过 3000 次训练迭代后,基线 0.83M 参数模型的验证损失达到 1.7236。更强的 10.77M 参数配置,使用更大的上下文长度和改进的训练设置,达到 1.4780 的最佳验证损失,并生成具有可识别的莎士比亚风格对话结构的文本。 MiniGPT 没有引入新的语言模型架构。相反,它记录了从原始文本到经过训练的字符级生成的清晰且可重复的实现路径,包括设计选择、训练行为、生成质量和实际限制。