论文

同样文本,不同预测:文本分类服务环境的非确定性

Same Text, Different Prediction: Serving-Context Nondeterminism in Text Classifiers

模型评测AI 基础设施推理服务模型行为与机制分析鲁棒性、公平性与可信度评测

摘要

确定性推理对于可靠且值得信赖的机器学习至关重要。先前对文本生成的研究表明,即使提示、模型参数和采样随机性是固定的,改变批次大小、批次组成、硬件或推理引擎等因素也可能改变生成的文本。这些差异部分归因于浮点非关联性、形状相关的内核选择以及数值执行中的其他实现级别差异。然而,目前尚不清楚相同的因素是否、何时以及在多大程度上影响文本分类。我们对文本分类器中的服务上下文非不变性进行了系统研究,之前的工作仅通过生成的文本来测量。我们训练了 180 个模型,涵盖判别式、伪生成式和完全生成式分类器公式,并在四个类别的服务上下文中评估每个模型,保持检查点和文本固定。标签稳定性并不意味着分数稳定性。在 fp32 比较中,仅更改批次形状不会改变标签,但在 bf16 下,预测概率质量的变化高达 56.7 个百分点,标签变化集中在很小的范围内。在相同的服务变化下,完全生成分类器比判别性分类器改变更多的标签。我们得出了每次服务变化下标签稳定性的充分条件,并为每种机制提供了单独的缓解措施。我们的结果确定并量化了可重复文本分类必须固定的服务条件。