论文
用户事件序列的行为基础模型的缩放定律
Scaling Laws for Behavioral Foundation Models over User Event Sequences
摘要
基础模型越来越多地接受推荐、支付、欺诈和商业中用户操作序列的训练,但这些模型仍然缺乏缩放定律为语言模型提供的那种计算校准。我们研究了一种常见的两部分行为模型架构:基于特征的事件嵌入器将每个多模态项映射到向量,仅解码器 Transformer 从结果序列中预测下一个事件。在真实交互数据上的大约 600 次运行中,跨越 $10^{15}$-$10^{19}$ 训练 FLOP,我们共同改变了四个与部署相关的轴:两部分参数分割、关键批量大小、模型/数据分配以及冻结嵌入器后使用的采样负数数量。小型嵌入器(参数的 $s^{\star}\!\approx\!2\%$)在我们测试的每个预算下都是计算最优的,因为嵌入器参数每步的成本更高,并且比上下文化器参数暴露出更多的重复项。相对于低计算量的文本,计算最优训练需要大量数据,但随着计算量的增加,其 $D/N$ 比率向 Chinchilla 启发式移动。采样的训练目标和部署的排名指标在自身扩展方面存在分歧:临界批量大小、冻结后的最佳负计数以及损失和排名质量之间的一致性都会随着计算和所选评估指标的变化而变化。对于负采样,更大的预算越来越倾向于更多的负样本; $10^{19}$ FLOPs 的主动约束是候选轴内存而不是 FLOPs。因此,在行为基础模型中,评估指标是缩放法则的一部分:改变它可以改变计算最优配方。