论文
训练-推理内核合约:后训练 和部署中的边界分歧
Training-Inference Kernel Contracts: Bounding Divergence in Post-Training and Deployment
摘要
现代 后训练 管道通常为其策略 pi_theta 写入一个符号,同时通过两个不同的程序对其进行评估:一个针对 autograd 优化的训练内核,以及一个针对低精度、融合、动态批处理服务优化的推理内核。在有限精度下,这些内核可以在相同的权重下产生不同的分布,其中差距集中在聚合基准代表性不足的切片上。本文提出了内核契约:用于指定 K_train 和 K_inf 之间可接受的差异的契约优先框架。合约 C = (N, S, R, O, Pi) 将数值、统计、运行时和可观察性条款与从违规到路由操作的升级策略相结合。我们推导了从 logits 漂移到总变异距离到有界奖励漂移的一系列界限,并将其专门用于 RL 后训练,其中每个词元重要性比漂移在显式支持和规范假设下产生绑定 同策略 梯度偏差。我们还描述了合约工件的四阶段升级管道、在线路由循环和最小 YAML DSL。这是一篇框架和词汇论文;我们没有报告生产规模的实证验证。