论文

面向LLM端点稳定性与身份识别的行为指纹

Behavioral Fingerprints for LLM Endpoint Stability and Identity

AI 基础设施可观测性

摘要

AI原生应用的一致性取决于为其提供支撑的模型端点的行为一致性。传统的可靠性指标如正常运行时间、延迟和吞吐量无法捕捉行为变化;当权重、分词器、量化、推理引擎、内核、缓存、路由或硬件发生更新时,端点可能在有效模型身份已改变的情况下依然保持“健康”。我们提出Stability Monitor,一个黑盒稳定性监测系统,它通过从固定提示集采样输出并比较随时间变化的输出分布,定期为端点采集行为指纹。指纹比较采用跨提示求和的能量距离统计量,以置换检验p值作为分布漂移证据,并按顺序聚合以检测变化事件和定义稳定期。在受控验证中,Stability Monitor能检测到模型家族、版本、推理栈、量化及行为参数的变化。在对多家服务商托管同一模型的真实监测中,我们观察到服务商之间及服务商内部都存在显著的稳定性差异。

面向LLM端点稳定性与身份识别的行为指纹:论文配图
图2:对比多家托管Kimi-K2-0905-Instruct的服务商在两日内的行为指纹差异,用于检测端点稳定性与身份一致性。